从 RAG 到评估革命:OpenAI 论文戳破AI幻觉的底层逻辑,可信AI缺的不只是数据
大家好,我是微信公众号技述馆。
上篇文章我们聊到,RAG(检索增强生成)通过 “先找数据再回答” 的逻辑,从根源上补上了 AI “瞎编信息” 的一块短板 —— 毕竟有真实文档兜底,总比模型闭着眼 “创造事实” 靠谱。但是在实际使用中,我们会发现用了 RAG,AI 还是会偶尔编细节,比如瞎编事件地点、时间,这又是为什么呢?
直到 OpenAI 最新发表的《Why Language Models Hallucinate》(语言模型为何会产生幻觉)**论文,这个问题才有了系统性答案。这篇罕见的技术长文没有堆砌复杂公式,反而用 “评估机制” 和 “数据模式” 两个维度,戳破了 AI 幻觉的底层逻辑。**今天,我们就从技术本质出发,拆解这篇论文的核心发现,看看如何从 “评估层” 与 “RAG 层” 双管齐下,真正走向可信 AI。
一、幻觉的 “罪魁祸首”:评估体系在“奖励猜测”
在上一篇关于 RAG 的文章中,我们提到 “闭卷考试”(仅依赖模型预训练知识)会导致知识过时或缺失,进而引发幻觉。但 OpenAI 的论文指出,即便解决了 “知识有没有” 的问题,“评估好不好” 的问题仍会让幻觉存在 —— 因为当前的评估体系,本质上是在做 “错误的激励”。
我们可以用一个类比理解:假设你参加一场多项选择题考试,规则是 “答对得 1 分,答错得 0 分,不答得 0 分”。此时,即便你完全不会,“瞎蒙” 也有 1/n 的概率得分,“不答” 则必定得 0 分。理性选择下,你会倾向于 “蒙答案” 而非 “认不会”。
OpenAI 给出的数据更直观:在 SimpleQA 评估中,早期模型 OpenAI o4-mini 的 “准确度” 为 24%,高于 gpt-5-thinking-mini 的 22%,但前者的 “错误率”(即幻觉率)高达 75%,后者仅 26%。原因很简单:o4-mini 在不确定时选择 “硬猜”,靠概率提升了准确度;而 gpt-5-thinking-mini 选择 “弃权”,虽然准确度略低,但避免了大量幻觉。
| 模型 | 弃权率(说 “不知道”) | 准确率(答对) | 错误率(幻觉) |
|---|---|---|---|
| GPT-5-thinking-mini | 52% | 22% | 26% |
| OpenAI o4-mini | 1% | 24% | 75% |
而更关键的问题在于:现在主流的模型评测基准(比如 GPQA、MMLU-Pro、Omni-MATH 等),几乎都只看 “准确率” 这一个指标。排行榜上的模型,谁准确率高谁排第一,没人关心 “这个准确率是靠真本事还是靠猜”。
这就形成了一个死循环:开发者为了冲榜,会刻意训练模型 “多猜少弃权”;哪怕 RAG 已经帮模型找到了 90% 的正确信息,面对剩下 10% 不确定的内容,模型还是会选择 “硬编”—— 因为 “编错” 比 “说不知道” 更能提升准确率排名。
二、从 “下一个词预测” 看:有些幻觉本就 “与生俱来”
除了评估体系的外部问题,OpenAI 还从模型训练的内部逻辑,解释了 “为什么有些幻觉注定会出现”—— 这与大模型的核心训练目标 “下一个词预测” 密切相关。
我们知道,大模型的预训练阶段,本质是 “在海量文本中学习预测下一个词”。这个过程有个关键特点:**没有 “错误示例”,只有 “流畅示例”**。模型看到的都是符合语法、逻辑通顺的文本,但无法直接学到 “哪些句子是错误的事实”。
就像教一个孩子说话时,只给他看正确的句子,却不告诉他 “哪些话是假话”,他长大后自然难以区分 “流畅的话” 和 “真实的话”。更麻烦的是,有些事实本身是 “低频且随机的”—— 比如某个人的生日、某篇论文的发表年份,这些信息在语料中出现频率极低,且没有明显的 “模式” 可寻。
OpenAI 用图像识别做了个类比:如果用 “猫 / 狗” 给照片打标签,算法能轻松学会分类;但如果用 “宠物生日” 打标签,无论算法多先进,都只能靠 “猜”—— 因为生日本身是随机的,没有视觉特征可捕捉。同理,大模型对 “低频随机事实” 的预测,本质上就是 “无模式可依的猜测”,自然容易产生幻觉。
这也解释了为什么 RAG 能缓解部分幻觉:RAG 通过实时检索外部知识,为 “低频随机事实” 提供了 “标准答案”,相当于给模型提供了 “开卷考试的参考书”。但如果评估体系仍在鼓励模型 “猜答案”,即便有参考书,对于检索不到或者有歧义的内容模型也可能会猜 —— 毕竟 “猜” 更可能得分。
三、破局之道:双管齐下,重构可信 AI 的 “两大支柱”
结合上篇文章的 RAG 技术,以及 OpenAI 论文的新发现,我们可以清晰地看到:构建可信 AI,需要 “RAG 的知识锚点” 与 “模型评估体系的激励重构” 双管齐下。
第一支柱:用 RAG 解决 “知识有没有” 的问题
RAG 的核心价值,是让 AI 从 “闭卷考试” 转向 “开卷考试”—— 通过实时检索权威数据库、文档库的信息,为回答提供 “事实依据”。比如询问 “某篇论文的标题” 时,RAG 能直接检索学术数据库,获取准确信息,而非让模型依赖预训练时的模糊记忆 “瞎猜”。
第二支柱:用 “新评估” 解决 “激励对不对” 的问题
OpenAI 在论文中提出了明确的改进方向:对 “自信错误” 的惩罚要远大于 “表达不确定”,同时为 “恰当弃权” 提供部分奖励。
这个思路并非首创 —— 比如有些考试会对错误答案扣分,以此遏制盲猜;一些教育评估会为 “不答” 提供少量分数,鼓励学生诚实面对知识盲区。但 OpenAI 强调,关键不在于 “增加几个新评估指标”,而在于 “重构主流评估体系”:
- 打破 “二元评分” 陷阱:不再仅区分 “对 / 错”,而是建立 “对(高分)> 弃权(低分)> 错(零分 / 负分)” 的三级评分体系,让模型学会 “认不会” 比 “瞎猜” 更划算。
- 将 “谦逊度” 纳入核心指标:像 gpt-5-thinking-mini 将“弃权率”、“错误率”与 “准确度”并重,避免了开发者只盯着 “准确度” 优化。
- 更新基准测试库:现有 10 个主流评估基准中,9 个不支持 “弃权得分”,需要重新设计评估规则,让 “表达不确定性” 成为模型的加分项。
写在最后:可信 AI 的本质,是 “对不确定性的诚实”
从 RAG 的 “开卷考试”,到评估体系的 “奖励谦逊”,我们逐渐意识到:AI 的 “可信”,不在于它能 “永远答对”,而在于它能 “清晰地分辨自己知道什么、不知道什么”。
OpenAI 的论文,与其说是 “找到幻觉的罪魁祸首”,不如说是 “提醒我们重新思考 AI 的价值取向”—— 我们究竟需要一个 “擅长猜答案、拿高分” 的 AI,还是一个 “诚实、严谨、知道边界” 的 AI?
当评估体系开始奖励 “我不知道”,当 RAG 为 “我知道” 提供坚实依据,AI 才能真正摆脱 “幻觉魔咒”,从 “会说话的工具”,变成 “可信赖的伙伴”。而这,或许才是 AI 技术走向成熟的关键一步。
更多推荐



所有评论(0)