AI_02_大模型开发技术发展史
学习目标¶
- 知道大模型幻觉是什么
- 了解大模型应用的四种技术方案
一、 大模型幻觉问题¶
大模型的幻觉,即是指大模型的生成结果中包含了无根据的或错误的内容。

1、事实性幻觉 (Factuality)¶
强调生成内容与可验证的现实世界事实之间的差异,表现为:
事实不一致 (factual inconsistency):LLM的输出包含了可以在现实世界信息中找到基础的事实,但存在矛盾
捏造事实 (fabrication):LLM的输出包含了无法与现实世界知识验证的事实
原因:
- 知识过时:模型的训练数据有截止日期,无法获取最新的信息。例如,询问一个在训练数据截止后发生的事件,模型可能会根据旧知识进行猜测,从而产生事实错误。
- 数据不准确:互联网上的训练数据本身包含大量错误信息、偏见或矛盾的内容。模型学习了这些数据,也就学会了其中的错误。
2、忠实性幻觉 (Faithfulness)¶
关注生成内容与用户指令或输入上下文的一致性,表现为:
- 不遵循指令 (Instruction inconsistency):LLM的输出和用户指令不一致
- 不遵循上下文 (in-Context inconsistency):LLM的输出和用户提供的上下文信息不一致
- 回复内容逻辑不一致 (Logical inconsistency):出现在推理任务中,表现为推理步骤之间或者推理步骤和答案之间不一致
原因是:
- 指令的模糊性与复杂性:当用户指令模糊、复杂或包含多重约束时,模型可能无法准确捕捉所有要点,只能执行它“认为”是核心的任务,而忽略其他细节。
- 推理能力的不足:在复杂的多步推理任务中,模型可能在某个推理步骤上犯了一个微小的、不易察觉的逻辑错误,但这个错误会导致后续所有步骤和最终结论的失败。
二、 提示词工程¶
通过精妙的指令设计,约束模型行为。

引导模型进行结构化思考,明确其答案的边界和依据。
案例1:结构化会议记录生成
用户提问:
请根据以下内容生成格式化会议记录:
本次周会决定,由张三在11月15日前完成市场分析报告初稿,并由李四在月底前完成官网UI redesign。
大模型回答结果:
周会会议记录
会议类型:周会
会议核心决议及任务分配
任务 1:市场分析报告初稿撰写
负责人:张三
交付要求:完成报告初稿
截止时间:11 月 15 日前
任务 2:官网 UI redesign
负责人:李四
交付要求:完成官网 UI 重新设计
截止时间:本月底前
利用情境学习的方式提问:
# 任务定义
你是一个信息提取专家,负责从会议纪要中精准提取行动项,并转换为标准JSON格式。
# 输出规范
## JSON Schema
{
"action_items": [
{
"item": "决议事项的完整描述(保持原文关键信息)",
"owner": "仅包含负责人姓名,如'张三'",
"deadline": "严格遵循YYYY-MM-DD格式的日期"
}
]
}
示例:
# 示例
## 输入文本
“本次周会决定,由张三在11月15日前完成市场分析报告初稿,并由李四在月底前完成官网UI redesign。”
## 期望输出
```json
{
"action_items": [
{
"item": "完成市场分析报告初稿",
"owner": "张三",
"deadline": "2024-11-15"
},
{
"item": "完成官网UI redesign",
"owner": "李四",
"deadline": "2024-11-30"
}
]
}
请根据以下内容生成结构化信息:
开发团队确认,小王需要在2025年12月31日前完成v2.0版本的核心功能开发,小张负责在年底前完成所有测试用例的编写。
输出结果为:
{ "action_items": [ { "item": "完成v2.0版本的核心功能开发", "owner": "小王", "deadline": "2025-12-31" }, { "item": "完成所有测试用例的编写", "owner": "小张", "deadline": "2025-12-31" } ] }
提示词工程无法赋予模型新的知识,其效果依赖于模型固有的能力,对于知识盲区导致的幻觉治标不治本。
三、模型微调¶
通过数据驱动的方式,从根本上调整模型参数,使其在特定领域内更可靠。

使用高质量的、事实准确的领域数据对模型进行再训练,强化其产生正确事实的模式,抑制胡编乱造。
案例说明: 一家医药公司要开发一个内部药物问答助手。他们拥有权威的、结构化的药物说明书数据库。
- 从数据库中构建了数十万条
(问题,标准答案)对,然后使用LoRA技术对基础模型(如LLaMA)进行微调。 - 微调后的模型在面对药物相关问题(如“阿司匹林的禁忌症是什么?”)时,其回答将严格基于提供的说明书数据,幻觉率显著降低。因为它被“塑造”成了一个药物领域的专家,而非泛泛而谈的通才。
四、 检索增强生成(RAG)(“外部知识库”)¶
这是目前解决事实性幻觉最有效、最流行的工程架构。

将大模型与外部知识源(如数据库、文档库、互联网)连接。在回答问题时,先检索相关证据,再让模型基于证据生成答案。
案例企业2:内部知识库问答
业务需求:模型需要能阅读公司内部的《员工福利政策V2.3.pdf》并给出准确答案。
场景:用户问:“我们公司今年的团建预算标准是多少?什么时候申请?”
期望回答:
根据2024年发布的《员工福利政策V2.3》,今年的部门团建预算标准为人均500元。申请通道在每年6月和12月开放,需通过OA系统提交‘团队活动申请’表单。”
模型回答:

上述回答并没有真正解决用户的需求,不解决私有数据问题,模型在内部业务场景中无法发挥核心价值的。
RAG从根本上解决了模型的“知识更新”和“私有知识”问题,是扼杀事实性幻觉的利器。
五、 AI Agent¶
Agent将大模型从“内容生成器”提升为“动作执行者”,其核心架构天然包含了对抗幻觉的机制。
核心思路:模型作为“大脑”,可以规划步骤、调用工具(如搜索引擎、代码解释器、计算器)来验证自己的猜想或弥补知识短板。
案例3:差旅费报销审核
假设我们员工差旅的需求报销,如果不使用思维链,模型可能会直接给出一个错误的答案。但通过引导模型,它可以正确解决问题。
直接提问:
员工提交了一份差旅费报销单,包含以下项目:
高铁票: 550元
市内交通费: 120元
住宿费: 400元/晚 x 3晚 = 1200元
餐饮补贴: 150元/天 x 3天 = 450元
公司规定如下:
交通费实报实销,高铁票限二等座。
住宿费标准:一线城市(如北京、上海)上限为500元/晚,其他城市上限为400元/晚。本次出差城市为上海。
市内交通费每日限额50元。
餐饮补贴按出差天数发放,标准为100元/天。
请问,本次可报销的总金额是多少?
大模型回答的结果:
本次可报销的总金额为 2320 元。
总金额计算
550 元(高铁票)+ 120 元(市内交通费)+ 1200 元(住宿费)+ 450 元(餐饮补贴)= 2320 元。
上述回答明显是错误的。
使用方式提问:
请根据公司规定,逐步审核以下差旅费报销单。请遵循“思维链”的推理方式,一步一步地分析,并在最后给出结论。
报销单项目:
高铁票: 550元
市内交通费: 120元
住宿费: 400元/晚 × 3晚 = 1200元
餐饮补贴: 150元/天 × 3天 = 450元
公司规定:
交通费实报实销,高铁票限二等座。
住宿费标准:一线城市(如北京、上海)上限为500元/晚,其他城市上限为400元/晚。本次出差城市为上海。
市内交通费每日限额50元。
餐饮补贴按出差天数发放,标准为100元/天。
请按以下步骤推理:
第一步:分析和审核高铁票费用。
思考:公司对高铁票的规定是什么?申请的金额是否符合规定?
判断:
可报销金额:
第二步:分析和审核住宿费。
思考:上海属于哪类城市?住宿费标准上限是多少?申请金额是否超标?
判断:
可报销金额:
第三步:分析和审核市内交通费。
思考:出差总天数是多少?市内交通费的总限额是多少?申请金额是否在限额内?
判断:
可报销金额:
第四步:分析和审核餐饮补贴。
思考:公司标准是多少?按天数计算的总补贴限额是多少?申请金额是否超标?
判断:
可报销金额:
第五步:汇总计算最终可报销总额。
将前面各步核准的可报销金额相加。
最终可报销总额:
大模型回答结果:
第一步:分析和审核高铁票费用
思考:公司规定交通费实报实销,高铁票限二等座。未提及该高铁票座位等级超标,申请金额 550 元符合实报实销要求。判断:符合公司规定。可报销金额:550 元。
第二步:分析和审核住宿费
思考:上海属于一线城市,公司规定一线城市住宿费上限为 500 元 / 晚。员工申请 400 元 / 晚,未超过上限。判断:符合公司规定。可报销金额:1200 元。
第三步:分析和审核市内交通费
思考:出差总天数为 3 天,公司规定市内交通费每日限额 50 元,总限额为 150 元。员工申请 120 元,在总限额内。判断:符合公司规定。可报销金额:120 元。
第四步:分析和审核餐饮补贴
思考:公司规定餐饮补贴标准为 100 元 / 天,3 天总限额为 300 元。员工申请 150 元 / 天,总金额 450 元,超出限额。判断:部分超标。可报销金额:300 元。
第五步:汇总计算最终可报销总额
550 元(高铁票)+ 1200 元(住宿费)+ 120 元(市内交通费)+ 300 元(餐饮补贴)= 2170 元。最终可报销总额:2170 元。
Agent通过将模型的“思考”与外部世界的“验证”相结合,构建了一个动态的、自我修正的系统,极大地提升了输出的可靠性。
六、本节小结¶
对抗大模型幻觉是一场多维的战争,没有单一的银弹。一个健壮的工业级系统往往是多种技术的融合:
| 技术 | 作用层面 | 核心价值 | 适用场景 |
|---|---|---|---|
| 提示词工程 | 交互界面 | 低成本、即时生效的引导 | 简单事实查询、逻辑推理任务 |
| 模型微调 | 模型内部 | 塑造领域专家,从根本上减少领域内幻觉 | 医疗、法律、金融等专业领域 |
| RAG | 系统架构 | 提供实时、准确的外部知识证据 | 知识库问答、客户服务、企业数据分析 |
| AI Agent | 系统架构 | 动态规划与验证,处理复杂、开放世界任务 | 数据分析、研究报告生成、复杂问题求解 |
未来趋势是构建 “微调过的模型大脑 + RAG知识心脏 + Agent协作四肢” 的超级个体。例如,一个金融分析师Agent,其核心是一个经过LoRA微调的金融模型,通过RAG接入实时市场数据和公司财报,并能自主调用计算工具进行估值建模。
幻觉问题将长期存在,但随着这些技术的不断成熟与深度融合,我们正一步步地将这头“虚构的巨兽”驯服成值得信赖的得力助手,真正释放大模型在关键任务中的巨大潜力。
更多推荐


所有评论(0)