大模型幻觉:AI为何会胡说八道?
·
什么是幻觉
简单来说,就是模型一本正经的胡说八道,当模型生成的文本不遵循指令或原文或者不符合事实,就可以认为模型出现了幻觉。
大模型是概率模型,束缚就是条件概率中的前文条件。幻觉选择的虚假事实需要与补白所要求的内容类型一般都是匹配的,“张三”可以幻觉为“李四”,但不大可能幻觉成“石头”。大模型的知识学习过程(训练阶段),是一种信息压缩过程;大模型回答问题,就是一个信息解码过程(推理阶段)。好比升维了又降维。一个事实冗余度不够就被泛化为一个上位的父类,到了生成阶段这个父类必须具像化为子类进行补白。“张三”这个事实忘了,但“human”这个父类的约束还在。补白就找最合理、与父类概念最一致的一个实体,于是“李四”或“王五”的幻觉就可以平替“张三”。
幻觉分为两种
- 事实性幻觉:生成的内容和可验证的真实世界事实之间的差异,通常表现为与事实不一致。更进一步分为“事实性错误”和“编造事实”两类幻觉。
- 忠实性幻觉:表现为生成内容与用户输入的差异或生成内容本身缺乏自我一致性。更进一步可分为“与用户指令不一致”、“与上下文不一致”、“逻辑不一致”
是什么导致了LLM幻觉
LLM幻觉有多方面的根源,跨越LLM能力获取过程到模型输出的整个范围
- 训练数据偏差:模型学到了大量失真的数据,比如从一些非官方的渠道获取的真真假假的语料
- 模式匹配而非理解:模型只是根据输入“预测下一个词”并不真正“理解”内容真假
- 过度自信输出: 即使不确定,模型也会给出完整、流畅的回答,让人误以为是正确的
1. 预训练阶段
- 预训练语料错误信息和主观偏见:大模型的训练数据都是通过众包/爬虫检索方式收集得到的,这种数据构建方式的优点是量大,但是缺点是包含大量虚假或偏见信息。这种信息直接导致的问题就是使模型出现错误认知
- 长尾信息:语料库中的知识分布可能是不均匀的,导致LLM在不同类型的知识有不同的熟练程度。对于信息冗余度不足的事实,模型就容易编造
- 模型知识无法非实时更新:一旦LLM被训练,它们的内部知识就永远不会更新。当遇到超越其时间范围的查询时,LLM通常会捏造事实或提供过去可能正确但现在已经过时的答案。
2. SFT阶段和RLHF阶段
- SFT一般被认为是用来解锁LLM的能力,并且SFT通常强制模型完成每个响应,而不允许它们准确地表示不确定性。但当SFT的需求超过模型预训练模型能力边界时,模型就会倾向于编造内容,从而放大幻觉发生的可能性
- 在RLHF阶段,模型也会倾向于编造以获得更高收益,这在RLHF中有个专有名称——“谄媚”(sycophancy),这种现象可能是由人类和偏好模型共同驱动的。
3. 推理阶段
- 采样温度的升高也会导致更均匀的令牌概率分布,增加了从分布尾部以较低频率采样令牌的可能性,增加幻觉风险
- 由于因果语言模型本身的特性,一旦模型输出错误token,接下来就会发生级联错误,一步错,步步错。
如何检测幻觉
当前幻觉检测方法大致可以分为以下几类:
- 内部检测:比如自我评估、内部表征检测、答案反推问题等
- 外部检测:大多数情况下外部检测方法使用强LLM来决定响应是否是幻觉。比如我们认为大CA机构的背书颁发的网站数字证书就能证明该网站的可靠性、安全性。
如何应对LLM幻觉
- 交叉验证:对重要信息(历史、科学、医学)用多个来源核实,再不济用多个大模型验证
- 提问方式优化:避免模糊提问。举例,你用模糊查询的方式查询出来的结果也是不精确的。
- 使用事实核查工具:结合搜素引擎、权威数据库等进行验证
- 保持批判性思维:不要完全信任大模型给出的结论。比如就像 DY视频段子,问某大模型这个蘑菇可以吃吗,结果中毒了,后来大模型说了一句sorry
如何缓解幻觉
- RAG:RAG核心机制是通过引入外部知识库或实时数据弥补大模型参数知识的局限性,大部分情况会根据检索到的外部信息为生成过程提供明确边界,模型需基于这些事实生成回答(非自由发挥),这种将数据作为答案来源而非仅靠模型输出回答的方法能有效降低模型"胡乱编造"信息的倾向。
- 基于概率的经验主义与基于规则符号系统结合:让基于概率的模型做它擅长的事,对于一些固化的流程或者一些不允许出错的关键配置等引入基于规则的符号系统。 比如在Agent架构中结合外部工具或规则约束的方法。
- deep research:是openai推出的高级agent,主要流程为 【搜素->慢思考】* n ——> 生成,来帮助用户完成复杂的多步骤信息检索与研究任务。用户只需提供一个提示或问题,Deep Research可自主联网检索、分析总结各类信息源,以高可读的专业分析报告模板输出。结合慢思考的多轮检索可以有效缓解幻觉问题,但代价就是执行速度会大大减慢。
- 强化学习:在训练阶段应用强化学习来惩罚模型生成不真实信息的行为。OpenAI等公司的经验显示,RLHF调教后的模型幻觉率显著下降。例如GPT-4在内部事实性评测中比GPT-3.5高出40%的得分,幻觉现象明显减少。这得益于训练中人为地奖励正确事实、惩罚错误输出,使模型更倾向于给出可靠答案
- Router思路:可以训练一个充当“调度员”的小模型,它会根据任务类型,安排不同的模型来处理,不要指望一个模型解决所有问题,各个模型都有其擅长的领域,让专业的模型做专业的事,既可以降低成本又可以一定程度上减轻幻觉。
更多推荐


所有评论(0)