关于大模型的一些你可能不知道的知识
·
文章目录
大模型基础知识笔记
一、开源模型 vs 闭源满血模型的差距
1. 训练数据量和质量(最大差距来源)
| 维度 | 开源模型 | 闭源满血模型 |
|---|---|---|
| 文本数据 | 公开数据集(Common Crawl、Wikipedia 等) | 公开 + 海量私有数据(用户交互、内部标注数据) |
| 数据清洗 | 依赖社区,质量参差 | 专业团队清洗,有专门的 data curation 流水线 |
| 代码数据 | GitHub 公开仓库 | 公开 + 内部代码库 |
| 多语言 | 英语为主,中文偏弱 | 精心配比的多语言语料 |
OpenAI 的训练数据量是公开模型的好几倍,而且有很多拿不到的数据(比如 ChatGPT 的用户对话反馈)。
2. 对齐训练(Alignment)
满血模型最强的部分不是预训练,而是对齐阶段:
- SFT(监督微调):闭源模型有大量人工标注的高质量对话数据,开源模型基本靠合成的
- RLHF(强化学习):OpenAI 有专门的标注团队做偏好排序,这个成本极高
- DPO/ORPO 等替代方案:开源模型用的,效果接近但上限低一些
简单说:满血模型更"听话"、更"懂你",不是因为更聪明,而是因为被调教得更精。
3. 推理算力(Compute)
- 训练算力:120B 参数全量训练需要上万张 H100,成本千万美元级。开源模型通常用较少的算力
- 推理时的 compute scaling:满血模型背后有庞大的推理集群,可以做更激进的投机采样、长链推理等优化
- 蒸馏技术:满血模型可以用更大的教师模型蒸馏,开源模型没这个条件
4. 工程体系
| 方面 | 开源 | 闭源 |
|---|---|---|
| MoE 架构 | 粗粒度路由 | 细粒度、动态路由,更高效 |
| 长上下文 | 128K-256K | RoPE 优化 + 更好的注意力机制 |
| 多模态 | 拼接式训练 | 原生多模态,视觉理解更深 |
| 推理优化 | vLLM 等通用框架 | 定制化推理引擎 |
5. 数据飞轮(最致命的差距)
用户使用 → 产生反馈数据 → 改进模型 → 更好用 → 更多用户
OpenAI 每天有上亿次对话,这些数据持续喂养模型。开源模型没有这个飞轮,更新靠社区贡献,速度和质量都跟不上。
总结
上限差距的本质:不是参数量的问题,而是数据 + 对齐 + 工程投入的综合差距。120B 参数如果训练到位,智能水平可以很强,但在"好用程度"上跟 GPT-4 级别的满血模型还是有明显差距。
二、长文本注意力衰减(Lost in the Middle)
核心问题
大模型处理长文本时,注意力分布非常不均匀:
- 开头:注意力较强 ✅
- 中间部分:注意力明显下降 ❌
- 结尾:注意力又回升 ✅
这是 Transformer 架构的固有缺陷,不是哪个模型的问题,所有主流模型都有这个现象。
具体表现
| 现象 | 说明 |
|---|---|
| 中间遗忘 | 长文档中间的信息容易被忽略,模型倾向于关注开头和结尾 |
| 细节丢失 | 能记住大致内容,但具体数字、人名、日期等细节容易搞混 |
| 位置偏差 | 同样的信息放在不同位置,模型处理结果可能不一样 |
| 幻觉增加 | 找不到信息时倾向于编造,而不是承认不知道 |
各模型上下文窗口 vs 实际有效范围
| 模型 | 上下文窗口 | 实际有效范围 |
|---|---|---|
| GPT-4 | 128K | 约 32-64K |
| Claude | 200K | 约 100-150K |
| GLM-4 | 128K | 约 32-64K |
| Qwen | 128K | 约 50-80K |
实际有效范围通常是上下文窗口的 30%-70%,越长的上下文衰减越严重。
缓解方法
输入端优化:
- 关键信息放开头或结尾
- 用 RAG 检索相关片段,而不是塞整篇文档
- 分段处理,每段控制在有效范围内
模型端改进:
- RoPE 位置编码扩展:支持更长上下文
- YaRN / NTK-aware 缩放:缓解长文本位置编码退化
- 稀疏注意力:Longformer、BigBird 等,只关注部分 token
- Ring Attention:分布式处理超长上下文
- RAG + 摘要:先压缩再处理
三、知识蒸馏技术(Knowledge Distillation)
核心原理
用大模型教小模型,让小模型学到大部分能力,但成本低得多。
打个比方:大学教授(大模型)讲课,本科生(小模型)听课学习。本科生虽然不如教授,但比自学强得多。
教师模型(大) → 输出结果/中间层知识 → 学生模型(小)
GPT-4(1.8T) 训练信号 Qwen-7B
两种主要方式
1. 输出蒸馏(最常用)
大模型生成答案,小模型学着生成一样的答案:
输入:解释量子纠缠
教师模型(GPT-4)→ "量子纠缠是一种量子力学现象,两个粒子……"
学生模型(小模型)→ 学习模仿这个输出
损失函数:学生输出 vs 教师输出的差异越小越好
- 优点:简单直接,效果显著
- 效果:小模型能获得大模型 70%-90% 的能力
2. 知识蒸馏(更深)
不只学输出,还学大模型的"思考过程":
- Logit 蒸馏:学大模型每个 token 的概率分布(不只是最终选的那个)
- 特征蒸馏:学大模型中间层的隐藏状态
- 注意力蒸馏:学大模型关注哪些词
普通训练:学 ground truth(标准答案)
蒸馏训练:学 teacher 的软标签(概率分布)
比如:
普通:猫 = 1,狗 = 0,兔 = 0
蒸馏:猫 = 0.85,狗 = 0.10,兔 = 0.05(更丰富的信息)
为什么闭源模型有优势
| 方面 | 闭源 | 开源 |
|---|---|---|
| 教师模型 | 可以用万亿参数的内部模型 | 只能用公开的大模型 |
| 蒸馏数据量 | 海量,覆盖各种场景 | 有限,成本高 |
| 迭代速度 | 持续蒸馏、持续优化 | 一次性蒸馏,更新慢 |
OpenAI 内部可能有 GPT-4 级别甚至更强的模型做教师,蒸馏出 GPT-4o-mini、o3-mini 等小模型。这些小模型看起来参数少,但背后是巨人的知识。
实际效果
GPT-4o(满血) → 基准 100%
GPT-4o-mini(蒸馏) → 约 85-90%,成本低 10 倍
Qwen-72B(蒸馏) → 接近 GPT-4 水平
GLM-4-Flash(蒸馏) → 接近大号模型,推理速度快 5 倍
总结
蒸馏就是把大模型的"智慧"压缩到小模型里,用 1/10 的成本获得 80%+ 的能力。这是目前性价比最高的模型优化手段之一。
更多推荐



所有评论(0)