大语言模型综述与展望
在介绍LLM的基础架构、训练技术及发展历程的基础上,分析当前通用的 LLM关键技术和以 LLM为底座的先进融合技术。
通过归纳总结现有研究,进一步阐述 LLM在实际应用中面临的挑战,包括数据偏差、模型幻觉和计算资源消耗等问题,并对LLM的持续发展趋势进行展望。
一、专业名词介绍
1、自监督学习(Self-Supervised Learning) 是“让数据自己标注自己”;
自监督学习并不是没有监督,而是监督来自数据内部结构,不是人工标签。
“监督信号”指的是:模型自己设计的预测任务(即“预任务”或“proxy task”)中被隐藏、被预测的那部分数据。
2、半监督学习(Semi-Supervised Learning) 是“少量人标注 + 大量无标注数据协作学习”。
数据分两类——有标签(少)和无标签(多)。 利用有标签数据训练初步模型,再用无标签数据辅助优化。
3、智能体
“智能体”(Intelligent Agent,简称 Agent)这个概念看似科幻,其实是人工智能研究的核心抽象之一。简单来说,智能体就是一个能感知环境、作出决策并执行行动以达到目标的系统。
整个过程是一个循环: 感知 → 推理/学习 → 行动 → 环境变化 → 再感知。
AI Agent 的本质是:
让大语言模型(如 GPT、Claude、Gemini)不仅生成文字,还能“思考—决策—执行”。
也就是说,它不只是“被动回答”,而是“主动完成任务”。 在形式上,一个标准的 AI Agent 循环包括:
感知(Perceive) → 思考(Reason / Plan) → 行动(Act) → 反馈(Reflect / Learn)
它会根据环境和任务目标,不断自我调整策略。
通用人工智能(AGI)
4、检索增强生成(RAG)
RAG 是“把语言模型变聪明”的方法——让它在生成前先查资料,用检索到的知识增强生成能力,从而实现“有依据的智能回答”。
5、模型幻觉
“模型幻觉”(Model Hallucination)指的是大语言模型在生成内容时输出了听起来合理、但实际上错误或虚构的信息。
幻觉的根本原因在于:
模型是根据训练数据中的统计规律预测下一个词,而不是理解事实真伪。
所以当模型缺乏真实知识或上下文约束时,它会“编造最可能的句子”来维持语言连贯。 比如:
-
问它“谁发明了圆周率”,模型可能瞎编一个名字,因为训练语料中没有对应事实。
-
让它总结一篇未提供的文档,它可能生成风格正确但内容错误的摘要。
应对方式
-
引入检索(RAG):在生成前查找真实资料。
-
事实验证(Fact-checking):在生成后用独立模块核对。
-
模型对齐(Alignment):通过指令调优让模型更谨慎地回答。
-
6、生成式人工智能(Generative AI)
生成式人工智能(Generative AI)是一类能够自动生成新内容的人工智能技术,输出形式可以是文本、图像、语音、视频、代码甚至分子结构。
均为BERT的网络架构设计特点
7、掩码语言建模(Masked Language Modeling,MLM)
8、下句预测(Next Sentence Prediction,NSP)
9、能量函数建模
Deepseek训练策略
10、混 合 专 家 模 型(Mixture of Experts,MoE)策略
11、前缀解码器(Prefix Decoder)和因果解码器(Causal Decoder)架构
12、领域知识监督微调(Supervised Fine-Tuning,SFT)
对齐使用者偏好
SFT 主要包括指令微调(Instruction Fine-Tuning)、基于人类反馈的强化学习微调(Reinforcement Learning from Human Feedback,RLHF)以及高效微调
高效微调主要分为提示微调和低秩自适应(Low-Rank Adaptation,LoRA)微调
13、自回归生成
自回归生成(Autoregressive Generation)是大模型(尤其解码器架构模型)实现 “连续文本 / 序列生成” 的核心范式,核心逻辑是:像人写字一样 “逐 token 生成”,每一步预测都严格依赖前面已经生成的所有内容,且不允许 “偷看” 后面未生成的信息,最终拼接成完整、连贯的输出序列。
一、核心原理:“逐 token 依赖” 的生成逻辑
以生成句子 “今天天气很晴朗” 为例,自回归生成的过程可拆解为严格的步骤:
-
初始输入:模型先接收一个 “起始标记”(如
[CLS]或<s>),作为生成的 “起点”。 -
第一步预测:基于 “起始标记”,模型预测第一个 token,输出 “今”。
-
第二步预测:将 “起始标记 + 今” 作为新输入,模型仅基于这两个已有的 token,预测第二个 token,输出 “天”。
-
后续迭代:每一步都将 “历史生成的所有 token(起始标记 + 今 + 天 +…)” 作为输入,预测下一个最可能的 token(如 “天”→“气”→“很”→“晴”→“朗”)。
-
终止条件:当模型预测到 “结束标记”(如
[SEP]或</s>)时,停止生成,拼接所有 token 得到最终输出。
整个过程中,每一步的预测都只依赖 “前文”(已生成内容),完全符合人类 “从左到右” 的语言表达习惯。
二、关键机制:如何保证 “不偷看未来”?
自回归生成的核心约束是 “不能利用未来信息”,这通过因果注意力掩码(Causal Attention Mask) 实现 —— 在解码器的自注意力计算中,模型会给 “当前 token 之后的位置” 加上一个 “掩码”(可理解为 “遮挡板”),让这些位置的注意力权重强制为 0,从而彻底屏蔽 “未来 token” 的信息干扰。
例如,在预测第 3 个 token “气” 时,模型的注意力只能关注 “起始标记、今、天” 这 3 个已生成的 token,无法 “看到” 后面的 “很、晴、朗”—— 这种机制从底层保证了生成的 “因果一致性”,避免出现逻辑混乱(如先生成 “晴朗” 再回头生成 “天气”)。
三、典型特征:优势与局限
-
核心优势
-
生成连贯性强:因每一步都依赖前文,生成的序列在语法、语义逻辑上更通顺(如对话中能衔接上文语境,故事生成能保持情节连贯)。
-
支持开放域生成:无需预设输出结构,可灵活生成任意长度、任意主题的内容(如创意写作、开放域问答、代码补全)。
-
适配人类语言习惯:“逐 token 从左到右” 的生成方式,天然匹配人类阅读和表达的顺序,输出更易被理解。
-
主要局限
-
生成速度慢:必须 “串行生成”(一个 token 生成完才能开始下一个),无法并行计算,长文本生成耗时较长(如生成 1000 字需迭代 1000 次)。
-
可能存在 “累积误差”:若某一步预测出错误 token(如把 “晴朗” 误预测为 “qinglang”),后续步骤会基于这个错误继续生成,可能导致整体逻辑断层或语义偏差。
四、典型应用与代表模型
自回归生成是解码器架构模型的 “标配”,几乎所有侧重 “生成能力” 的大模型都采用这一范式:
-
代表模型:GPT 系列(GPT-3、GPT-4)、Llama 2、PaLM、Falcon 等。
-
核心应用场景
:
-
开放域对话(如 ChatGPT 的闲聊、客服对话);
-
创意内容生成(小说、诗歌、文案);
-
实用文本生成(邮件、报告、代码);
-
知识问答(基于前文问题生成答案)。
-
简言之,自回归生成通过 “逐 token 依赖、屏蔽未来信息” 的设计,平衡了生成的连贯性与逻辑一致性,是当前大模型实现高质量文本生成的主流技术路径。
14、因果注意力掩码
因果注意力掩码(causal attention mask) 是 Transformer 中的一种“信息屏蔽机制”,主要用于 防止模型在生成下一个词时看到未来的信息。
换句话说:它强制模型“只能看见自己前面的词”,保证生成是一步步“因果的”,而不是作弊式地窥视未来。
15、零样本学习
16、少样本学习
二、NLP发展的三个阶段
2.1 规则驱动阶段
通过人工定义语言规则实现机器对语言的处理。研究者基于语言学理论(如乔姆斯基的生成语法)构建语法规则库和词典,试图让计算机理解句子结构和语义。
局限性:规则需人工编写,难以覆盖复杂语法和歧义语境。例如,“咬死了猎人的狗” 这类句法歧义句无法通过规则有效解析。此外,系统扩展性极差,新增词汇或语法结构需重新设计规则库,导致实用性极低。
2.2 统计学习阶段(基于概率的方法)
随着计算机算力提升和语料库建设,NLP 转向数据驱动的统计方法。研究者通过概率模型从大规模文本中学习语言模式,解决了规则方法的扩展性问题。
局限性:依赖人工设计特征(如词性组合、上下文窗口),对长距离语义依赖和复杂语义理解能力不足。例如,处理 “他说他明天去北京” 这类指代关系时,统计模型难以捕捉深层语义关联。
2.3 深度学习阶段
2010 年后,神经网络技术彻底改变了 NLP 的研究范式。深度学习模型通过多层非线性网络自动学习语言特征,摆脱了对人工特征的依赖:
-
词向量革命:2013 年 Word2Vec 将词语转化为低维稠密向量(如 “国王 - 男人 + 女人≈女王”),首次实现语义的数值化表示。
-
序列建模突破:循环神经网络(RNN/LSTM)和卷积神经网络(CNN)被用于机器翻译和情感分析。2014 年基于 LSTM 的神经机器翻译(NMT)系统大幅提升翻译质量,成为行业标准。
-
Transformer 架构:2017 年 Google 提出的 Transformer 以自注意力机制替代时序依赖,可并行处理文本并捕捉长距离语义关联(如 “小明说他今天不舒服” 中 “他” 的指代),成为后续所有大模型的基础。
-
预训练模型范式:2018 年 BERT 通过双向预训练学习上下文语义,在 11 项任务中刷新纪录,推动 NLP 进入 “预训练 + 微调” 时代。同期,GPT 系列(生成式预训练模型)通过自回归方式生成连贯文本,GPT-3(2020)的 1750 亿参数模型甚至实现了少样本学习能力。
三、大语言模型基础架构
3.1 编码器架构(Encoder-only)
1️⃣ 编码器架构(Encoder-only)
-
结构:仅包含多层自注意力 + 前馈层。
-
注意力类型:双向注意力,每个token都能看到整个上下文。
-
典型用途:文本理解类任务。
-
示例:BERT 用于情感分析、问答、命名实体识别等。
-
-
示意:
输入句子 → Encoder → 语义表示
-
优势:全局理解能力强。
-
劣势:不能自然地进行生成(缺乏自回归结构)。
3.1.1 BERT(Bidirectional Encoder Representations from Transformers)
由 Google 于 2018 年提出,是 Encoder-only 架构的里程碑模型。它基于多层 Transformer 编码器构建,通过 “掩码语言模型(MLM)+ 下一句预测(NSP)” 的预训练任务,让模型同时从 Token 的左右两侧学习上下文(如区分 “银行(金融机构)” 和 “银行(河岸)” 的歧义)。模型分为 BERT-Base(12 层编码器、12 个注意力头、1.1 亿参数)和 BERT-Large(24 层编码器、16 个注意力头、3.4 亿参数),开创了 “预训练 + 微调” 的 NLP 范式 —— 先在海量无标注文本(如维基百科)上学通用语言知识,再用少量标注数据适配下游任务(文本分类、问答、实体识别等)。它曾刷新 11 项 NLP 任务纪录,还被整合到 Google 搜索引擎,提升长尾复杂查询的理解精度。
3.1.2 RoBERTa(Robustly Optimized BERT)
作为 BERT 的优化变体,RoBERTa 通过一系列策略强化性能:移除 NSP 任务(改用更精准的句间关系学习方式)、采用动态掩码(训练中持续随机调整被掩码的 Token,避免模型过拟合固定模式)、扩大训练数据与批次大小(如批次从 256 增至 8192,结合梯度累积提升训练稳定性)。这些优化让 RoBERTa 在 GLUE、SQuAD 等多个 NLP 基准测试中全面超越原版 BERT,成为更鲁棒的自然语言理解模型,尤其擅长长文本语义建模与复杂问答任务。
3.1.3 ALBERT(A Lite BERT)
主打 “轻量化” 设计的 Encoder-only 模型。它通过参数共享(Transformer 编码器层间共享注意力、前馈网络的参数)和因式分解嵌入(将高维词嵌入分解为低维矩阵乘积),大幅压缩参数量(如 ALBERT-base 的参数量仅为 BERT-base 的 1/18),同时保持性能。此外,ALBERT 用 “句子顺序预测(SOP)” 替代 NSP,更精准学习句间语义关系(判断句子是否为原顺序)。在资源受限场景(如边缘设备部署)或大规模应用中,ALBERT 能以更低的计算成本,取得接近 BERT 的下游任务效果。
3.1.4 ModernBERT
ModernBERT 是由 Answer.AI、LightOn 与 Hugging Face 等联合研发的先进 encoder-only(仅编码器)模型,对传统 BERT 进行了多维度升级:
-
长上下文能力:通过旋转位置编码(RoPE),原生支持 8192 token 的超长文本(是原始 BERT 的 16 倍),能高效处理长文档。
-
架构与效率优化:禁用冗余偏差项、采用 GeGLU 激活函数;创新 “全局 + 局部” 交替注意力机制(平衡全序列与局部语境建模);结合 “无填充(unpadding)” 与 Flash Attention,大幅提升推理速度、降低内存占用。
-
训练与数据:基于 2 万亿(以英文为主,含代码、科学文献)的海量数据预训练,还通过分阶段扩展文本长度等策略,让模型在下游任务更鲁棒。
它在 ** 自然语言理解(如 GLUE 基准)、文本检索(含长上下文、代码检索)** 等任务中表现突出,且兼顾性能与效率,适合长文档处理、语义搜索、代码相关场景,还推出了 ModernBERT-base(22 层、1.49 亿参数)、ModernBERT-Large(28 层、3.95 亿参数)等不同规模版本。
3.2 解 码 器 架 构(Decoder-only)
2️⃣ 解码器架构(Decoder-only)
-
结构:多层带有因果mask的自注意力 + 前馈层。
-
注意力类型:单向(左到右)自注意力,只看历史token。
-
典型用途:生成类任务。
-
示例:GPT系列、LLaMA、Claude。
-
-
示意:
上下文token → Decoder(自回归生成) → 下一token
-
优势:擅长自然语言生成(续写、问答、创作)。
-
劣势:缺少全局双向上下文,对理解类任务略弱。
常见的使用 ** 解码器架构(Decoder-only)** 的大模型,核心基于 “自回归生成” 原理(从左到右逐 token 预测,依赖前文上下文,通过 “因果掩码” 避免泄露后续信息),擅长开放域生成类任务。典型代表包括:
3.2.1 GPT 系列(OpenAI)
从 GPT-1 到 GPT-4 持续演进,采用纯解码器架构,以 “下一个词预测” 为核心预训练目标。其中,GPT-3凭借 1750 亿参数量的超大规模预训练,首次展现出强大的 “零样本 / 小样本学习” 能力(无需微调即可适配新任务);GPT-4进一步强化多模态能力(支持图像 - 文本联合理解)与长上下文理解(输入 token 长度可达数万),在开放域对话、创意写作、复杂逻辑推理(如数学题、代码生成)等场景中表现突出。
3.2.2 Llama 2(Meta)
开源且可商用的纯解码器大模型,采用优化的因果注意力机制与训练策略,提供 7B、13B、70B 等多参数量版本。它在对话生成、代码补全、知识问答等任务中表现优异,且因开源属性拥有活跃的社区生态,开发者常基于它微调衍生垂直领域模型(如医疗、法律场景的专用模型)。
3.2.3 PaLM(Google)
Google 研发的大规模纯解码器模型,依托超大规模预训练与架构优化,在自然语言生成、逻辑推理、数学问题解决等任务上优势明显。它为 Google 后续多模态大模型(如 PaLM 2)奠定了基础,能在长文本语境下生成连贯、复杂的内容。
这类解码器架构模型的共性优势的是:生成能力强(天然适配对话、创作等任务)、推理效率高(可通过 KV 缓存加速逐 token 生成过程)、零样本泛化能力出色(无需大量微调即可应对新任务),因此成为生成型大模型的主流选择。
3.3 编 码 器-解 码 器 架 构(Encoder-Decoder)
3️⃣ 编码器-解码器架构(Encoder-Decoder)
-
结构:编码器提取语义 → 解码器生成目标序列。
-
解码器的注意力包括:
-
自注意力(生成历史)
-
编码器-解码器注意力(关注输入序列)
-
-
-
典型用途:输入到输出的“翻译式”任务。
-
示例:机器翻译、摘要生成、对话生成。
-
模型代表:Transformer原版、T5、BART。
-
-
示意:
源句子 → Encoder → 语义向量 → Decoder → 目标句子
-
优势:兼具理解与生成能力。
-
劣势:结构复杂、计算开销大。
3.3.1 T5(Text-to-Text Transfer Transformer,Google)
T5 将所有 NLP 任务统一为 “文本到文本” 形式(如翻译任务输入 “translate English to French: Hello”,输出 “Bonjour”),核心是 Transformer 的编码器 - 解码器架构。预训练任务为 “Span Corruption”:随机遮盖输入文本中的连续片段,让模型预测完整内容。它支持多规模版本(从小型到 11B 参数),在机器翻译、文本摘要、问答等 Seq2Seq 任务中表现全面,且因统一任务格式便于迁移适配新场景。
3.3.2 BART(Bidirectional and Auto-Regressive Transformers,Meta)
BART 基于 Transformer 编码器 - 解码器,编码器采用类似 BERT 的双向注意力(理解输入),解码器采用类似 GPT 的自回归生成(生成输出)。预训练通过 “破坏输入 + 还原原始文本” 实现:对输入文本施加多种噪声(如随机删除 token、打乱句子顺序、替换片段等),让模型还原原文。这种设计让它兼顾理解与生成能力,在文本摘要、机器翻译、文本纠错等任务中表现优异,尤其擅长处理 “输入存在噪声或不完整” 的场景。
3.3.3 mT5(Multilingual T5,Google)
mT5 是 T5 的多语言版本,在 101 种语言的海量文本上预训练,保留编码器 - 解码器架构和 “文本到文本” 统一任务形式。它专门优化了低资源语言的处理能力,能支持跨语言翻译(如中文到阿拉伯语)、多语言摘要、跨语言问答等任务,是多语言 Seq2Seq 场景的主流选择。
这类模型的核心优势是输入与输出的灵活映射:编码器可深度理解输入的全局语义,解码器则基于此生成符合任务需求的输出,因此成为机器翻译、文本摘要、代码生成(输入需求文本,输出代码)等 “转换型任务” 的首选架构。
3.4 架构差异
编码器架构中的双向自注意力(Bidirectional Self-Attention) 是模型实现 “全局上下文理解” 的核心机制,其核心作用是让序列中的每个 Token(如单词、子词)能同时 “关注” 到序列中所有其他 Token(无论位置在左还是在右),从而捕捉全句范围内的语义关联。
具体工作原理可分为三步:
-
生成注意力计算的核心向量
对于输入序列中的每个 Token,模型会生成三个向量:
-
查询向量(Query, Q):代表 “当前 Token 想关注什么”;
-
键向量(Key, K):代表 “其他 Token 能提供什么信息”;
-
值向量(Value, V):代表 “其他 Token 的具体信息内容”。
这些向量由 Token 的嵌入表示通过三个不同的线性层转换得到。
-
-
计算双向注意力权重
每个 Token 的 Query 会与序列中所有 Token(包括自身、左侧和右侧 Token) 的 Key 进行匹配,通过内积计算 “相关性分数”(分数越高,说明两个 Token 的语义关联越紧密),再经过 softmax 归一化得到注意力权重(权重总和为 1)。
例如,在句子 “他在银行存钱,利率很高” 中,“银行” 的 Query 会与 “存钱”“利率” 的 Key 计算出高权重,从而重点关注这些相关 Token。
-
融合上下文信息
用每个 Token 的注意力权重,对所有 Token 的 Value 进行加权求和,得到该 Token 的 “上下文感知表示”—— 即融合了全序列中所有相关 Token 信息的新向量。
由于这个过程中没有对 “右侧 Token” 做任何屏蔽(区别于解码器的 “因果注意力”,后者会屏蔽右侧 Token 以保证自回归生成),每个 Token 能同时吸收左侧和右侧的信息,这就是 “双向” 的核心含义。
双向性的关键价值:
它让模型能突破 “单向顺序依赖” 的限制,从全局语境中理解歧义。例如:
-
对 “苹果” 这个词,在 “吃苹果” 中会结合 “吃”(左侧)理解为水果;在 “苹果手机” 中会结合 “手机”(右侧)理解为品牌。
-
这种全局关联的捕捉能力,正是 BERT 等编码器模型在文本分类、实体识别、问答等 “理解类任务” 中表现优异的核心原因。
简言之,双向自注意力通过 “全序列 Token 无差别交互”,让编码器能构建出真正融合上下文的语义表示,为深层语言理解提供了基础。
可视化描述(文本版)
假设:
-
编码器输出长度为 6(含2个PAD)
-
解码器已生成 3 个词
Cross-Attention 权重矩阵大小:3×6 Mask 形状一致。 被 mask 的位置(PAD)设为 -∞:
Encoder tokens → [A, B, C, D, PAD, PAD] Decoder token1 → [✓, ✓, ✓, ✓, ×, ×] Decoder token2 → [✓, ✓, ✓, ✓, ×, ×] Decoder token3 → [✓, ✓, ✓, ✓, ×, ×]
最终 softmax 后,被遮蔽的两列注意力为 0。
Cross-Attention Mask 是解码器的“输入视野调节器”, 它确保解码器在生成过程中只关注有意义的编码器输出, 不被 padding、无效模态或越界片段干扰。
四、大模型训练与微调
4.1 训练
LLM 开发团队会先对海量语料进行清洗与重构, 然后设计预训练任务(语言建模、去噪自编码) 让模型在预测与复原中学会语言规律与知识表示, 最终通过大规模分布式优化训练, 把这些知识压缩进参数,使模型既能理解语言,又能生成高质量文本。
LLM 工程化训练阶段:
ZeRO(Zero Redundancy Optimizer)技术 、3D 并行技术和混合精度训练策略
-
使用 分布式并行训练(Data/Model/Pipeline Parallel);
-
应用 混合精度计算(FP16/FP8);
-
优化器如 AdamW、LAMB;
-
学习率调度、梯度裁剪、权重衰减等技巧。
通过这些工程优化,开发团队能在数百到数千 GPU 上:
-
让模型高效收敛;
-
避免梯度爆炸;
-
支持参数规模从亿到万亿级的扩展。
Mixture of Experts(MoE,专家混合模型)是一种提升大模型计算效率与参数规模可扩展性的训练方法,它的核心思想是:
让不同输入激活不同子模型(专家)进行计算,而不是每次都使用全部参数。
✅ 一句话总结: MoE 让“大模型只动部分脑细胞”——通过稀疏激活和专家分工,在不增加计算量的情况下,大幅扩展参数量与模型容量。
4.2 微调——领域知识监督微调(Supervised Fine-Tuning,SFT)
SFT 主要包括指令微调(Instruction Fine-Tuning)、以及高效微调
高效微调主要分为提示微调和低秩自适应(Low-Rank Adaptation,LoRA)微调
4.2.1 指令微调(Instruction Fine-Tuning)
指令微调的作用是让大语言模型学会理解并执行人类用自然语言表达的任务指令,从而具备通用任务执行能力。
指令微调技术是针对预训练语言模型(如 GPT、BERT 等)的一种后续优化方法,核心是用 “人类指令 - 响应” 格式的数据,对已具备通用知识的预训练模型进行二次训练,让模型更精准地理解人类意图、遵循明确指令,输出符合预期的结果
指令微调的实现依赖三个核心部分:
-
基础模型:已完成预训练的大语言模型(如 LLaMA、Falcon 等),提供通用语言能力和知识基础;
-
指令数据集
:格式为 “指令(Instruction)+ 输入(可选,如待总结的文本)+ 正确响应(Response)” 的标注数据,例如:
-
指令:“将以下英文翻译成中文”;
-
输入:“Hello, how are you?”;
-
响应:“你好,你过得怎么样?”;
-
-
训练目标:让模型学习 “给定指令和输入时,输出与标注响应一致的内容”,本质是通过梯度下降微调模型参数,优化 “指令 - 响应” 的匹配度。
4.2.2 基于人类反馈的强化学习微调(Reinforcement Learning from Human Feedback,RLHF)
基于人类反馈的强化学习(Reinforcement Learning from Human Feedback, RLHF) 是一种结合强化学习与人类偏好数据的技术,核心目标是让 AI 模型的输出更符合人类价值观、安全性和实用性。它是 ChatGPT、GPT-4 等大语言模型实现 “类人交互” 的关键技术之一,通过将人类反馈转化为可量化的奖励信号,引导模型优化生成策略。
1. RLHF 的核心原理
RLHF 的本质是通过人类反馈优化模型的 “决策逻辑”。传统强化学习依赖预设的奖励函数(如游戏中的得分),而 RLHF 将奖励信号的定义权交给人类,例如:
-
人类对模型生成的回答进行评分或排序(如 “回答 A 比 B 更有用”);
-
奖励模型(Reward Model)学习这些人类偏好,生成量化的奖励值;
-
强化学习算法(如 PPO)根据奖励值调整模型参数,使其生成更受人类欢迎的内容。
2. RLHF 的实现步骤
RLHF 通常包含以下四个核心阶段48:
(1)监督微调(Supervised Fine-Tuning, SFT)
-
目标:让模型初步学会遵循指令,例如 “写一封请假邮件”。
-
方法
:
-
使用人工标注的 “指令 - 响应” 数据(如 “解释相对论”→“爱因斯坦的理论...”);
-
通过监督学习(如交叉熵损失)微调预训练模型(如 GPT-3),得到 SFT 模型。
-
-
输出:具备基础任务能力的模型,但可能仍存在安全或质量问题。
(2)奖励模型训练(Reward Model, RM)
-
目标:量化人类偏好,生成可用于强化学习的奖励信号。
-
方法
:
-
让 SFT 模型对同一输入生成多个回答(如 “如何减肥?”→多个建议);
-
人类对这些回答进行排序(如 “回答 A 比 B 更科学”);
-
训练奖励模型(如 GPT 的变体)学习预测人类偏好,例如通过对比损失(Pairwise Loss)最大化优质回答的得分9。
-
-
输出:能为任意生成文本打分的奖励模型。
(3)强化学习优化(Reinforcement Learning, RL)
-
目标:使用奖励模型的评分优化模型策略,使其生成高奖励内容。
-
方法
:
-
策略网络(初始化为 SFT 模型)生成候选回答;
-
奖励模型对回答打分,强化学习算法(如 PPO)根据奖励值更新策略网络;
-
通过 “信任域限制”(如裁剪机制)确保模型不会偏离 SFT 学到的基础能力57。
-
-
输出:符合人类偏好的最终模型(如 ChatGPT)。
(4)迭代与评估
-
迭代优化:用更新后的模型生成新数据,重新训练奖励模型和策略网络,形成闭环;
-
评估方式
:
人工评估:专家打分(如有用性、安全性);
自动指标:计算与人类偏好的相关性(如 Spearman 系数)。
4.2.3 提示微调
提示微调(Prompt Tuning)*是一种轻量级的大模型微调方法,它不改动模型参数,而是*在输入前添加可学习的“提示向量”,通过优化这部分小参数来引导模型完成特定任务。
一句话总结:
提示微调是“教模型换种思路说话”,不改脑子(模型参数),只改提示,让它更好地理解任务。
4.2.4 低秩自适应(Low-Rank Adaptation,LoRA)微调
LoRA 通过引入低秩矩阵来调整预训练语言模型的权重,在保留预训练模型通用知识的同时,高效地学习特定任务所需的信息,从而显著降低微调过程中所需的参数量和计算资源。该技术首先在目标 LLM 权重矩阵中引入 2 个低秩矩阵组成的低秩适应层并随机初始化,用于捕捉特定任务的信息。在微调过程中,仅更新低秩适应层的参数,而保持模型的原始权重不变。在该处理下,不仅降低了需要训练的参数量,还避免了对预训练知识的破坏,使 LLM能够高效地学习新任务。由于仅低秩层发生变化,模型在保持通用能力的同时,具备特定任务的适应性。
五、大模型类别
在实际应用场景中,数据通常以多源、异构的形式存储,因此除了擅长处理文本的 LLM,擅长音频、视频、图像及时序数据的多模态大模型也同样被重点关注。
文本大模型‘
语音大模型
时序数据大模型
多模态大模型
六、小模型应用
在 边 缘 计 算 与 物 联 网 场 景 驱 动 下,小 型 大 语 言 模 型(Small LLM),即“小模型”,通过模型压缩技术实现了效率-性能的帕累托优化。核心技术集中在知识蒸馏、结构化剪枝与量化压缩 3 个维度。
1. 知识蒸馏(Knowledge Distillation) 让一个小模型(学生)学习一个大模型(老师)的输出分布。 学生模仿老师的预测概率或隐藏特征,从而在体积更小的情况下保持接近的性能。 一句话:大模型教小模型“怎么想”。
2. 结构化剪枝(Structured Pruning) 通过分析模型权重的重要性,删除不重要的神经元、通道或层,保留关键结构。 这种剪枝能显著减少计算量,同时仍可高效运行在硬件上。 一句话:像修树一样,剪掉枝叶保留主干。
3. 量化压缩(Quantization) 把模型中的浮点权重和激活值转化为低位整数(如从FP32变为INT8或INT4)。 减少存储需求和计算负担,几乎不影响精度。 一句话:让模型“说话”从32位变成8位,更省字但意思差不多。
三者结合使用,是让大模型真正落地(移动端、边缘设备等)的关键技术路径。
七、检索增强生成(RAG)
检索增强生成(Retrieval-Augmented Generation,RAG)技术的本质在于将传统的语言生成模型与外部知识源相结合。传统的 LLM 虽然能够在广泛任务中表现出色,但它们的知识库固定,且随时间逐渐过时。通过引入外部检索机制,RAG 使得模型可以实时检索到最新的、与任务相关的外部知 识,以 此 来 增 强 生 成 的 内 容,使 内 容 更 加 准 确 和 相 关。
RAG 流程分为索引构建、信息检索与内容生成 3 个步骤:
1)基于嵌入算法如 Text2Vec,每个文档块会被转换成固定维度的向量,便于后续检索阶段的相似度匹配;
2)当用户提出问题,查询会被转换为向量形式,并通过计算相似度算法与数据库中存储的向量进行比对,检索到与查询最相关的文档块;
3)检索到的文档块会作为上下文传递给 LLM,LLM 利用这些上下文信息生成最终的回答。
目前常见的 RAG 框架包括 LlamaIndex、LangChain、RAGflow 等,表 3 为这些框架间的不同与各自的优势。

这三者都是围绕 RAG(检索增强生成) 生态发展的框架,但定位不同、分工明确。可以理解为: LangChain 是管流程的,LlamaIndex 管数据的,RAGFlow 管全局的。
1. LlamaIndex(原名 GPT Index)
LlamaIndex 专注于知识接入与数据管理。 它的核心是帮助你把外部数据(PDF、数据库、网页、文档等)组织成可检索的知识索引,并高效地接入大语言模型。 主要功能包括:
-
文档加载与分块(Loader & Chunking)
-
索引构建与检索(VectorStore、GraphIndex等)
-
与LLM协同生成答案
一句话:LlamaIndex 是 RAG 的“知识入口”与“检索中枢”。
2. LangChain
LangChain 更像是一个大模型应用开发框架,负责任务编排与工具调用。 它让开发者能方便地:
-
串联模型、检索器、数据库、API 等模块;
-
构建对话系统、智能体(Agent)、问答系统等复杂应用。
它提供的核心组件包括:PromptTemplate、LLMChain、Memory、Tool、Agent。
一句话:LangChain 是 RAG 与智能体系统的“流程控制中心”。
3. RAGFlow
RAGFlow 是一种可视化、一体化的 RAG 工作流系统,由阿里或开源社区推动。 它集成了检索、索引、问答、评测等功能,常用于企业级知识问答系统的搭建。 特点:
-
图形化界面搭建RAG流程
-
内置数据清洗、分块、embedding、检索、答案生成等模块
-
支持多模型协同与评估
一句话:RAGFlow 是让企业“一键搭建 RAG 系统”的可视化平台。
总结一句:
LlamaIndex 解决“数据接入”,LangChain 解决“逻辑编排”,RAGFlow 解决“系统落地”。 三者配合,就能从“原始知识库”到“可用智能问答系统”形成完整链路。
八、智能体协同技术
“智能体”(Intelligent Agent,简称 Agent)这个概念看似科幻,其实是人工智能研究的核心抽象之一。简单来说,智能体就是一个能感知环境、作出决策并执行行动以达到目标的系统。
整个过程是一个循环: 感知 → 推理/学习 → 行动 → 环境变化 → 再感知。
AI Agent 的本质是:
让大语言模型(如 GPT、Claude、Gemini)不仅生成文字,还能“思考—决策—执行”。
也就是说,它不只是“被动回答”,而是“主动完成任务”。 在形式上,一个标准的 AI Agent 循环包括:
感知(Perceive) → 思考(Reason / Plan) → 行动(Act) → 反馈(Reflect / Learn)
它会根据环境和任务目标,不断自我调整策略。
通用人工智能(AGI)
一个智能体通常由 3 个关键部分构成:感知端(Perception)、控制端(Brain)和行动端(Action)[88-89] ,这 3 个框架的结构如图 5 所示。
感知端赋予智能体多模态感知能力,能够通过文本、视觉、听觉等多种输入感知世界,增强它与环境互动的能力;
控制端作为智能体的大脑,负责信息处理、决策和推理,由 LLM 提供支持,它使得智能体能够理解并生成自然语言,进行推理和规划;行动端则是将决策转化为具体行为的部分,包括文本输出、工具使用和具身行动,使智能体能够在物理或虚拟环境中执行任务。

九、具身智能体
随着多模态 LLM 和机器人技术的飞速发展,具身智能成了全球科技与产业竞争的热点。具身智能体通常具备感知、决策、行动和反馈 4 个核心模块[99-101] ,这些模块通过不断地交互与调整形成闭环,使智能体能够自主地理解环境并执行任务。
感知模块原理如图 6 所示,该框架通过视觉、触觉、听觉、深度等传感器收集环境信息,并对三维空间进行理解和分析;
决策模块将 LLM、VLM 和 RL 算法结合,进行任务规划和推理,指导智能体执行具体动作;
行动模块负责根据决策指令执行物理动作,如导航、抓取或交互,通常涉及机械臂、轮式或四足机器人等硬件;
反馈模块通过实时反馈环境变化,不断优化感知、决策和行动过程,增强系统适应性。
更多推荐


所有评论(0)