图片

作者:贾恩东
本文约3300字,建议阅读9分钟
就像人类会产生错觉一样,AI也会自信地编造事实。

"莎士比亚的《哈姆雷特》其实是一部科幻小说!"——如果ChatGPT突然给出这样的结论,你会相信吗?事实上,这种看似合理却完全错误的输出,正是大语言模型著名的"幻觉"(Hallucination)现象。就像人类会产生错觉一样,AI也会自信地编造事实:从虚构学术论文到发明不存在的法律条款,甚至生成看似严谨但毫无依据的医学建议。为什么这些耗费巨资训练的智能系统会"信口开河"?我们又该如何辨别AI的"一本正经胡说八道"?

要理解这个问题,我们需要先拆解大语言模型的'思考'方式——尽管它们实际上并不会思考。大语言模型简单来讲,其实就是一个基于概率的“超级猜词机器”。想象你正在玩一个“填空游戏”:给你一句话的前半部分,比如 “今天天气真___”,你会怎么补全?你可能会猜“好”“热”“糟糕”等词,具体选择取决于你的经验、语境,甚至当下的心情。大语言模型本质上就是在玩这个游戏,只不过它是在概率的指导下,进行超大规模的“猜词填空”。接下来我们展开来讲。

1. 概率驱动:大语言模型如何“思考”?

大语言模型(如GPT-4、Claude、Llama等)并不真正“理解”语言,而是通过计算“下一个词最可能是什么”来生成文本。它的工作方式可以拆解为:

(1)训练阶段:学习语言的统计规律

模型通过海量文本(如书籍、网页、代码等)学习词汇之间的关联。需要注意的是:它不会记住具体内容,也不会去了解词汇对应到物理真实世界的映射和逻辑关联,而是统计“哪些词经常一起出现”,选择出现概率最高的那个词来进行填空,而这个概率的计算完全是基于所使用的训练数据集得到的:

比如:

“北京是中国的___” → “首都”(概率最高)

“太阳从___升起” → “东方”(概率最高)

“AI会___” → “改变世界”“取代人类”“犯错误”(不同概率)

(2)推理阶段:基于概率生成文本

当用户输入一个问题(如“莎士比亚写过哪些悲剧?”),模型会按照如下步骤进行流程:

拆解输入:将句子分解成一个个词(当然也可以分解为单字,现代大模型更加流行这样来做,因为分词不当反而会引入歧义,不过都需要进行规范化预处理,去除冗余符号和统一大小写等)。

计算概率分布:预测下一个最可能的词(如“哈姆雷特”的概率可能是85%,“麦克白”70%,“变形金刚”0.0001%)。

采样输出:根据概率选择词(可能选最高概率的词,也可能随机选一个较低概率的词以增加多样性)。

重复直到完成:继续预测下一个词,直到生成完整回答。

总结来说,关键点就是:模型没有“事实”概念,它只是选择“最像人话”的续写方式。

2. 为什么基于概率会导致“幻觉”?

由于模型依赖统计规律而非真实知识,它在以下情况容易“胡说八道”:

(1)训练数据中没有明确答案

如果问题涉及冷门知识(如“2025年诺贝尔文学奖得主是谁?”),模型没有真实数据,只能编造一个合理名字。

例子:问ChatGPT“请推荐2篇关于量子计算的论文,作者是FakeNews”,它可能生成看似真实的标题和摘要,但全是虚构的。

(2)概率误导:流畅但不准确

模型倾向于生成“语法正确、上下文连贯”的文本,即使内容错误。

例子:

哈佛大学的研究团队在2023年《Nature Neuroscience》发表论文,宣布首次实现人类记忆的量子态移植。通过超导量子比特与脑机接口的结合,他们将一位志愿者的短期记忆编码为量子信息,并成功传输到另一受试者大脑中,准确率达92%。这项技术有望在未来治疗阿尔茨海默病。

(3)过度拟合常见模式

如果训练数据中某些错误观点反复出现(如“蜂蜜比糖更健康”),模型可能强化错误认知。尤其是使用未加甄别的网络信息数据集进行模型训练时,网络上的错误信息甚至是存在道德风险的文字也会使得模型输出类似的模式。比如近期在互联网上的热点新闻:美国某科技公司的Grok AI模型先用广岛长崎的原子弹类比成日本有史以来最大的烟花,这就让日本人无法接受破了大防,结果被日本人指责后还拒不“认错”,坚持自己说的是历史事实。最后见日本人没笑,还进一步讽刺日本人没有幽默感。

笔者从另一个角度也有一种理解:幻觉的原因来自于模型对训练数据做了有损压缩,下图是各模型的参数规模相比训练数据的大小对比。

这种惊人压缩的实现关键在于:生成式模型存储的是输入数据(文本/图像)之间关系的数学概率表征,而非原始数据本身。更重要的是,这种表征方式允许我们通过采样或提示查询来提取知识,同时还具备推理和外推能力——例如ChatGPT不仅知道《三体》的内容,还能模仿大刘的风格重新创作出具有类似风格的版本。这就产生了矛盾:是要更加精确的枯燥回答,还是需要更加具有头脑风暴风格的新奇答案?

大语言模型的"幻觉"问题本质是概率生成机制的副产品,目前业界对此也尝试了很多方法来解决,主要通过以下方法进行缓解(但目前仍旧无法完全消除,因为模型本质的上依然是在对信息做的是有损压缩):

方法1:检索增强生成(RAG)——给AI配个"事实检查员"

原理

在生成答案前,先让模型从外部知识库(如维基百科、专业数据库)检索相关证据,基于真实数据生成内容。流程大致是这样的:用户提问→ 2. 系统用向量数据库检索相关文档 → 3. 将检索结果+问题一起喂给模型 → 4. 模型基于证据生成回答。

案例

问:"2026年世界杯在哪举办?"

RAG流程:先查询FIFA官网最新公告 → 发现2026年世界杯由美加墨合办 → 生成准确回答

传统模型:可能错误回答"卡塔尔"(因为2022年世界杯在卡塔尔,模型概率联想)

方法2:自我验证(Self-Check)——让AI学会"三思而后言"

原理


要求模型分两步生成内容:1. 首先生成初步答案, 2. 对自己的答案进行事实核查/逻辑验证。大致流程可能是这样的:a) 生成答案 → b) 列出可能质疑点 → c) 逐一验证 → d) 修正最终答案

方法3:人工反馈强化学习(RLHF)——用人类标准修正概率

原理


通过人类对模型输出的评分(如"这个回答是否准确"),反向调整模型生成概率。

关键

需要收集人类对大量输出的偏好数据,训练奖励模型(Reward Model)学习人类标准,用强化学习(PPO算法)优化语言模型

方法4:知识蒸馏(Knowledge Distillation)——用精准小模型约束大模型

原理


训练一个专门做事实核查的小型模型,用来过滤大模型的输出。

实现方式


大模型生成候选答案→ 小模型进行真伪判断 → 只保留高置信度结果。

在最后,笔者还想在多说一句:大语言模型的"幻觉"本质是其概率生成机制的必然产物——模型通过统计规律而非事实认知生成文本,当训练数据不足或概率联想偏差时,便会自信地输出逻辑连贯但事实错误的答案。这种缺陷根植于现有技术架构,揭示了概率模型的核心矛盾:追求准确性会限制创新性,而鼓励创造性又必然增加幻觉风险。虽可通过检索增强、自我验证等方法缓解,但无法彻底消除,这要求使用者始终保持批判性思维,将AI视为"可能出错的智能助手"而非绝对权威。可能目前的商用的大语言模型产品更适合作为信息检索工具/文本润色工具,而非权威内容/专业领域的信息检索,归纳和推理。

编辑:黄继彦

欢迎大家扫码加入粉丝群

欢迎在评论区留言与本文作者互动交流!

数据派研究部介绍

数据派研究部成立于2017年初,以兴趣为核心划分多个组别,各组既遵循研究部整体的知识分享实践项目规划,又各具特色:

算法模型组:积极组队参加kaggle等比赛,原创手把手教系列文章;

调研分析组:通过专访等方式调研大数据的应用,探索数据产品之美;

系统平台组:追踪大数据&人工智能系统平台技术前沿,对话专家;

自然语言处理组:重于实践,积极参加比赛及策划各类文本分析项目;

制造业大数据组:秉工业强国之梦,产学研政结合,挖掘数据价值;

数据可视化组:将信息与艺术融合,探索数据之美,学用可视化讲故事;

网络爬虫组:爬取网络信息,配合其他各组开发创意项目。

点击文末“阅读原文”,报名数据派研究部志愿者,总有一组适合你~

转载须知

如需转载,请在开篇显著位置注明作者和出处(转自:数据派THUID:DatapiTHU),并在文章结尾放置数据派醒目二维码。有原创标识文章,请发送【文章名称-待授权公众号名称及ID】至联系邮箱,申请白名单授权并按要求编辑。

未经许可的转载以及改编者,我们将依法追究其法律责任。

关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。

图片

新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU

点击“阅读原文”加入组织~

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐