AI知识库相比传统知识库具有智能化检索优势,但其成功依赖于高质量数据。文章从普通员工、业务团队和CEO三个视角分析了知识库的重要性,指出AI知识库本质上是Agent,最终目的是通过知识辅助决策和行动。RAG技术作为核心,通过数据清洗、分块、向量和检索优化等步骤实现,解决了模型上下文不足、提高准确性、获取最新信息等问题,同时降低成本并减少幻觉。

前排提示,文末有大模型AGI-CSDN独家资料包哦!

传统知识库 vs AI 知识库

传统知识库多为“文档堆砌库”,需人工检索、筛选信息,某金融机构客服曾为查询一则利率政策,翻阅 200+页文档耗时 15 分钟。AI 知识库的通过智能化让用户想用、能用,能查到想要的信息,高质量的数据是 AI 知识库的基础,优质的数据更容易被大模型理解和调用。

到底什么是 AI 知识库?

接下来首先我们以使用者的角度进行思考和讨论

一般人眼中的公司 AI 知识库

  • 完善的知识库:包括公司的介绍、产品文档、技术文档、规章制度等等,方便员工进行实时检索
  • AI+知识库:AI 基于完善的知识库,结合实际语境上下文,给予用户符合知识库的最精准回答。
  • AI Agent:AI 基于知识库以及工作流,结合实际需求,完成预期的任务。

    以上的路径看上去很完美,但是第一步完善的知识库就拦住了 90%的公司,绝大多数的公司的根本没有文档,或者文档不全,即使有文档也是摆设,写了也不看。AI 知识库其实是数字化信息化转型的延续,没有完善的数据支撑,指望通过引入 AI 一步登天是不可能的。

业务团队的知识库

  • 公司的政策规定,市场的信息
  • 业务完成情况
  • 各类指导手册:问题处理解决方案,话术指导等等
  • 业务流程 SOP,AI 智能数据流转
  • 业务战略方向指引

CEO 的知识库

  • 公司客观信息:员工信息、项目信息、资源信息、公司氛围
  • 公司决策信息:选题建议、梯队建设、应急风控、企业迭代、CEO 陪伴
  • CEO 视角每件事情都应该有价值,资源用到了什么地方?如何将资源用到了地方?什么是有效资源的投入。
  • 通过对数据的重新组织,让 CEO 直观的看到钱花到哪里去了,有没有浪费,怎么花的更高效。

小结

通过这三个视角的知识库分析,我们可以得出所有的 AI 知识库都不是知识库,都是 Agent,我们想要不仅仅是知识,最终想要的是通过知识+AI 辅助我们做些什么…

AI 知识库基础概念

  • AI 知识库项目是 AI 项目的核心,而 RAG 是 AI 知识库的核心技术之一。
  • RAG(Retrieval Augmented Generation,检索增强生成)是一种结合信息检索和文本生成的技术方案

RAG 解决什么问题

  1. 模型上文长度不足的问题

早期的模型上下文严重不足,为了解决该问题所以需要将数据分片存储到向量数据库中,通过 RAG 进行存储和检索,以解决上下文不足的问题,随着模型上文的长度不断增加,RAG 的技术有可能被淘汰或者演进。

  1. 提高准确性

通过引用外部知识库,RAG能够弥补LLM 在特定领域知识或最新信息方面的不足,从而提高生成响应的准确性。

  1. 更新鲜的信息

RAG 能够访问实时更新的外部数据源,使得模型生成的响应更加及时和符合最新情况。

  1. 降低成本

与重新训练 LLM 相比,RAG 是一种更具成本效益的方式来增强 LLM 的能力,因为它无需对模型进行大规模的重新训练。

  1. 增强可解释性

RAG 可以提供生成响应所依据的外部来源,增强了响应的可解释性和可信度。

  1. 消除幻觉

基于确定性的知识能够让大模型的回答更加稳定,大幅度降低胡编乱造的可能性。

向量数据库

  • 用于存储、索引、 查询和检索高维向量数据。
  • 特别适合处理非结构化数据(如图像、音频、文本)。
  • 实现传统数据库难以完成的高级分析和相似性搜索。

向量库的本质到底是什么?其实它就是一个小模型,它筛选的准确性它一定没有大模型高,那为什么要用小模型?无非是考虑成本问题和一个那种速度效率问题。在单一的特定领域用微调用的小模型代替向量库效果会比用向量库的效果好很多。

经典 RAG 技术原理

流程如下图所示

知识入库

step1 数据清洗

  • **目的:**去除不必要的符号和不利于检索的内容。只保留结构化的文档内容,方便后续做分块处理。去除广告,转结构化,markdown 相对来说比较友好。
  • 处理方法
  1. 工程方式:用正则表达式,写代码实现
  2. 用大模型帮忙转换

step2 数据分块

  • 原则:每个分块都应该是一个完整的内容片段(中等长度)
  1. 内容相关
  2. 长度适中
  3. 语义完整
  • 常见的分块策略

    分块策略说明
    匹配表达式分块匹配特定的符号(\n 句号 ##)等
    NLP分块通过使用第三方的库 (NLTK/spaCy)等工具,做基础的语义理解和句子、段落结构的识别
    大模型分块基于语义理解对文档进行语义分段

一般来说第一步处理好,这边直接用特定字符分块就好了。

  • 数据分块的难点

    难点说明解决思路
    图文混排文档很多知识都是图文混排的,如PPT格式和PDF格式,里面都会存在大量的架构图、说明图片等内容。如果单纯的过滤掉图片,文字内容就会显得支离破碎,缺乏必要的语义和上下文。如果把图片单独做向量化存储,那么直接检索的意义和效果都非常差。对图片做识别,生成图片摘要,实际存储和检索的是图片摘要。
    数据版本问题同一份数据有多个不同的副本,导致数据差异做好知识库的更新策略
    数据歧义类似的数据,在不同的文档中都有描述,代表完全不同的意思做好知识库的切分,不同领域的知识放在不同的知识库中
    复杂问题检索需要跨多知识库文档进行检索分步检索 + GraphRAG

step3 向量化

  1. 密集向量

以向量之间的距离描述语义相似度,语义越相似,距离越接近

  1. 稀疏向量-全文检索

根据词在语料库中的频率和重要性为词分配权重,如下图所示,大部分的维度为0,省略不展示。

知识检索

Step1 检索前优化

  1. 原始问题改写

对检索关键词进行定向优化,提高检索效果

示例参考

假设用户在一个对话系统中先前提到:   我最近在学习Python编程。然后用户接着问:  我该如何开始?  在这个上下文中,系统可以将查询改写为:  我应该从哪些Python学习资源或项目开始?

通用提示词

请将以下用户的原始提问改写为一个更加具体和清晰的问题,以便更好地进行检索和生成:用户提问:{{原始提问}}
  1. Multi-Query

将单个查询拓展为多个相关的问题进行查询,从而丰富上下文内容的多样性和覆盖范围

提示词示例

你是一个AI语育模型助手。  你的任务是针对给定的用户问题生成五个不同版本的表述,以便从向量数据库中检索相关文档。  通过对用户问题生成多种角度的表述,你的目标是帮助用户克服基于距离的相似性搜索的一些局限性。  将这些替代问题用换行符分隔开。  原始问题:{question}
  1. Sub-question

将复杂问题拆解为多个简单问题

示例:

问题:Coze和Dify的区别?答案1:Coze基本介绍  -- 检索Coze知识库答案2:Dify基本介绍  -- 检索Dify知识库最终答案:结合答案1和答案2整理出二者的区别

Step2 知识召回

  1. 多路召回

多种方式多个通路进行召回,最后再合成结果

  1. RRF倒数排序融合算法

在多路召回中,仅使用每种结果的排名进行融合排序

Step3 检索后优化 --重排序

重排序是一个优中选优的过程,使用ReRank Model

主流平台知识库支持情况

总体情况

知识上传

知识解析&分块

知识库集成

知识检索

知识库集成

总结

今天简单分享到这里,具体的案例留到下次再分享。简单总结一下今天的内容:

  1. 知识库项目是AI项目的核心
  2. AI知识库,最难是优质数据
  3. 所有的AI知识库最终目的都不是知识库,都是Agent
  4. 经典RAG的流程
  • 入库:数据清洗 --> 数据分块 --> 向量化 --> 数据入库
  • 检索:向量化 --> 向量检索 --> 召回 --> 重排序 --> 根据上下文输出

读者福利:倘若大家对大模型感兴趣,那么这套大模型学习资料一定对你有用。

针对0基础小白:

如果你是零基础小白,快速入门大模型是可行的。
大模型学习流程较短,学习内容全面,需要理论与实践结合
学习计划和方向能根据资料进行归纳总结

包括:大模型学习线路汇总、学习阶段,大模型实战案例,大模型学习视频,人工智能、机器学习、大模型书籍PDF。带你从零基础系统性的学好大模型!

😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

请添加图片描述

👉AI大模型学习路线汇总👈

大模型学习路线图,整体分为7个大的阶段:(全套教程文末领取哈)

第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;

第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;

第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;

第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;

第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;

第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;

第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。

👉大模型实战案例👈

光学理论是没用的,要学会跟着一起做,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。

在这里插入图片描述

👉大模型视频和PDF合集👈

这里我们能提供零基础学习书籍和视频。作为最快捷也是最有效的方式之一,跟着老师的思路,由浅入深,从理论到实操,其实大模型并不难

在这里插入图片描述

👉学会后的收获:👈

• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;

• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;

• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;

• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。

👉获取方式:

😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐