大模型基础知识笔记

一、开源模型 vs 闭源满血模型的差距

1. 训练数据量和质量(最大差距来源)

维度 开源模型 闭源满血模型
文本数据 公开数据集(Common Crawl、Wikipedia 等) 公开 + 海量私有数据(用户交互、内部标注数据)
数据清洗 依赖社区,质量参差 专业团队清洗,有专门的 data curation 流水线
代码数据 GitHub 公开仓库 公开 + 内部代码库
多语言 英语为主,中文偏弱 精心配比的多语言语料

OpenAI 的训练数据量是公开模型的好几倍,而且有很多拿不到的数据(比如 ChatGPT 的用户对话反馈)。

2. 对齐训练(Alignment)

满血模型最强的部分不是预训练,而是对齐阶段:

  • SFT(监督微调):闭源模型有大量人工标注的高质量对话数据,开源模型基本靠合成的
  • RLHF(强化学习):OpenAI 有专门的标注团队做偏好排序,这个成本极高
  • DPO/ORPO 等替代方案:开源模型用的,效果接近但上限低一些

简单说:满血模型更"听话"、更"懂你",不是因为更聪明,而是因为被调教得更精。

3. 推理算力(Compute)

  • 训练算力:120B 参数全量训练需要上万张 H100,成本千万美元级。开源模型通常用较少的算力
  • 推理时的 compute scaling:满血模型背后有庞大的推理集群,可以做更激进的投机采样、长链推理等优化
  • 蒸馏技术:满血模型可以用更大的教师模型蒸馏,开源模型没这个条件

4. 工程体系

方面 开源 闭源
MoE 架构 粗粒度路由 细粒度、动态路由,更高效
长上下文 128K-256K RoPE 优化 + 更好的注意力机制
多模态 拼接式训练 原生多模态,视觉理解更深
推理优化 vLLM 等通用框架 定制化推理引擎

5. 数据飞轮(最致命的差距)

用户使用 → 产生反馈数据 → 改进模型 → 更好用 → 更多用户

OpenAI 每天有上亿次对话,这些数据持续喂养模型。开源模型没有这个飞轮,更新靠社区贡献,速度和质量都跟不上。

总结

上限差距的本质:不是参数量的问题,而是数据 + 对齐 + 工程投入的综合差距。120B 参数如果训练到位,智能水平可以很强,但在"好用程度"上跟 GPT-4 级别的满血模型还是有明显差距。


二、长文本注意力衰减(Lost in the Middle)

核心问题

大模型处理长文本时,注意力分布非常不均匀:

  • 开头:注意力较强 ✅
  • 中间部分:注意力明显下降 ❌
  • 结尾:注意力又回升 ✅

这是 Transformer 架构的固有缺陷,不是哪个模型的问题,所有主流模型都有这个现象。

具体表现

现象 说明
中间遗忘 长文档中间的信息容易被忽略,模型倾向于关注开头和结尾
细节丢失 能记住大致内容,但具体数字、人名、日期等细节容易搞混
位置偏差 同样的信息放在不同位置,模型处理结果可能不一样
幻觉增加 找不到信息时倾向于编造,而不是承认不知道

各模型上下文窗口 vs 实际有效范围

模型 上下文窗口 实际有效范围
GPT-4 128K 约 32-64K
Claude 200K 约 100-150K
GLM-4 128K 约 32-64K
Qwen 128K 约 50-80K

实际有效范围通常是上下文窗口的 30%-70%,越长的上下文衰减越严重。

缓解方法

输入端优化:

  • 关键信息放开头或结尾
  • 用 RAG 检索相关片段,而不是塞整篇文档
  • 分段处理,每段控制在有效范围内

模型端改进:

  • RoPE 位置编码扩展:支持更长上下文
  • YaRN / NTK-aware 缩放:缓解长文本位置编码退化
  • 稀疏注意力:Longformer、BigBird 等,只关注部分 token
  • Ring Attention:分布式处理超长上下文
  • RAG + 摘要:先压缩再处理

三、知识蒸馏技术(Knowledge Distillation)

核心原理

用大模型教小模型,让小模型学到大部分能力,但成本低得多。

打个比方:大学教授(大模型)讲课,本科生(小模型)听课学习。本科生虽然不如教授,但比自学强得多。

教师模型(大)    →    输出结果/中间层知识    →    学生模型(小)
GPT-4(1.8T)         训练信号                    Qwen-7B

两种主要方式

1. 输出蒸馏(最常用)

大模型生成答案,小模型学着生成一样的答案:

输入:解释量子纠缠
教师模型(GPT-4)→ "量子纠缠是一种量子力学现象,两个粒子……"
学生模型(小模型)→ 学习模仿这个输出

损失函数:学生输出 vs 教师输出的差异越小越好
  • 优点:简单直接,效果显著
  • 效果:小模型能获得大模型 70%-90% 的能力
2. 知识蒸馏(更深)

不只学输出,还学大模型的"思考过程":

  • Logit 蒸馏:学大模型每个 token 的概率分布(不只是最终选的那个)
  • 特征蒸馏:学大模型中间层的隐藏状态
  • 注意力蒸馏:学大模型关注哪些词
普通训练:学 ground truth(标准答案)
蒸馏训练:学 teacher 的软标签(概率分布)

比如:
普通:猫 = 1,狗 = 0,兔 = 0
蒸馏:猫 = 0.85,狗 = 0.10,兔 = 0.05(更丰富的信息)

为什么闭源模型有优势

方面 闭源 开源
教师模型 可以用万亿参数的内部模型 只能用公开的大模型
蒸馏数据量 海量,覆盖各种场景 有限,成本高
迭代速度 持续蒸馏、持续优化 一次性蒸馏,更新慢

OpenAI 内部可能有 GPT-4 级别甚至更强的模型做教师,蒸馏出 GPT-4o-mini、o3-mini 等小模型。这些小模型看起来参数少,但背后是巨人的知识。

实际效果

GPT-4o(满血)        → 基准 100%
GPT-4o-mini(蒸馏)   → 约 85-90%,成本低 10 倍
Qwen-72B(蒸馏)      → 接近 GPT-4 水平
GLM-4-Flash(蒸馏)   → 接近大号模型,推理速度快 5 倍

总结

蒸馏就是把大模型的"智慧"压缩到小模型里,用 1/10 的成本获得 80%+ 的能力。这是目前性价比最高的模型优化手段之一。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐