大模型修炼秘籍 第四章:神功初成——Transformer之架构
第四章:神功初成——Transformer之架构
注意力机制心神合,多头千手观音身。

【本章导读】
2017年,谷歌门派发表论文《Attention Is All You Need》,Transformer架构横空出世,如九阳神功现世,彻底改变了AI武学格局。本章将深入剖析这一革命性架构。
一、Transformer横空出世
【历史背景】
2017年之前,AI武学以RNN、LSTM为主流。这些功法虽有效,但存在致命缺陷:
- 时序依赖:必须按顺序处理,无法并行
- 长程遗忘:序列太长时,前面信息被遗忘
- 训练缓慢:计算效率低下
【Transformer之优势】
| 特性 | RNN/LSTM | Transformer |
|---|---|---|
| 并行计算 | 否 | 是 |
| 长程依赖 | 差 | 优 |
| 训练速度 | 慢 | 快 |
| 可扩展性 | 低 | 高 |
二、整体架构:天人合一
【架构总览】
Transformer由**编码器(Encoder)和解码器(Decoder)**两部分组成:
┌─────────────────────────────────────────────────────────────┐
│ Transformer架构 │
├─────────────────────────────────────────────────────────────┤
│ │
│ 输入 ──→ [编码器] ──→ 编码表示 ──→ [解码器] ──→ 输出 │
│ │
│ 编码器: 理解输入,提取特征 │
│ 解码器: 生成输出,逐词预测 │
│ │
└─────────────────────────────────────────────────────────────┘
【三种架构变体】
| 变体 | 结构 | 应用 | 代表模型 |
|---|---|---|---|
| Encoder-only | 仅编码器 | 理解任务(分类、抽取) | BERT |
| Decoder-only | 仅解码器 | 生成任务(对话、写作) | GPT系列 |
| Encoder-Decoder | 完整结构 | 序列到序列(翻译、摘要) | T5 |
大语言模型(LLM)主要采用Decoder-only架构。
三、注意力机制:心神合一
【注意力心法】
注意力机制是Transformer的核心,如同武学中的"心神合一"——能够聚焦于关键信息,忽略无关内容。
【Query、Key、Value】
自注意力使用三个概念:
| 概念 | 武学比喻 | 作用 |
|---|---|---|
| Query(查询) | 心神所向 | 当前关注的目标 |
| Key(键) | 招式特征 | 用于匹配的信息 |
| Value(值) | 招式内涵 | 实际传递的信息 |
【注意力计算】
输入序列 X
↓
线性变换得到 Q, K, V
↓
注意力权重 = softmax(QK^T / √d_k)
↓
输出 = 注意力权重 × V
【图解注意力】
输入: "大模型修炼秘籍"
处理"修炼"时:
┌──────────────────────────────────────┐
│ Query: "修炼"在问什么? │
│ │
│ Keys: │
│ "大" → 0.1 (相关性低) │
│ "模型" → 0.3 (有一定相关) │
│ "修炼" → 0.4 (自身最相关) │
│ "秘籍" → 0.2 (相关) │
│ │
│ 注意力权重: [0.1, 0.3, 0.4, 0.2] │
│ │
│ 输出 = 加权求和 │
└──────────────────────────────────────┘
【数学公式】
Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) VAttention(Q,K,V)=softmax(dkQKT)V
四、多头注意力:千手观音
【多头心法】
单头注意力只能学习一种关系模式。多头注意力如同千手观音,从多个角度同时观察,捕捉不同类型的关系。
【多头注意力结构】
输入 X
↓
┌─────────┬─────────┬─────────┬─────────┐
│ Head 1 │ Head 2 │ Head 3 │ ... │
│ (Q1,K1,V1)│ (Q2,K2,V2)│ (Q3,K3,V3)│ │
└────┬────┴────┬────┴────┬────┴─────────┘
↓ ↓ ↓
注意力1 注意力2 注意力3
└─────────┴─────────┘
↓
Concat拼接
↓
线性变换
↓
输出
【多头的意义】
不同头学习不同的关系:
| 头 | 可能学习的关系 |
|---|---|
| Head 1 | 语法关系(主谓宾) |
| Head 2 | 语义关系(同义词) |
| Head 3 | 指代关系(代词指代) |
| Head 4 | 位置关系(相邻词) |
五、位置编码:时空定位
【位置编码心法】
Transformer本身没有时序概念,无法区分"我爱你"和"你爱我"。位置编码为每个位置添加唯一标识,让模型知道Token的顺序。
【旋转位置编码(RoPE)】
现代大模型(如LLaMA、DeepSeek)使用旋转位置编码:
优点:
- 更好地捕捉相对位置关系
- 长度外推能力更强
- 计算效率高
六、前馈网络:内功修炼
【FFN结构】
输入 (d_model)
↓
线性层1: d_model → 4*d_model (扩展)
↓
激活函数 (GELU/SwiGLU)
↓
线性层2: 4*d_model → d_model (压缩)
↓
输出
【激活函数】
| 激活函数 | 使用模型 |
|---|---|
| ReLU | 早期模型 |
| GELU | BERT、GPT |
| SwiGLU | LLaMA、DeepSeek |
七、残差连接与层归一化:稳固根基
【残差连接】
输出 = Layer(x) + x
武学比喻: 如同修炼中保留根基,在原有功力基础上叠加新能力,而非完全替换。
【Pre-Norm vs Post-Norm】
| 方式 | 结构 | 使用 |
|---|---|---|
| Post-Norm | Layer + Norm | BERT |
| Pre-Norm | Norm + Layer | GPT-2+、LLaMA |
现代大模型普遍采用Pre-Norm。
八、Transformer完整结构
【Decoder-Only Transformer】
输入Token序列
↓
Token Embedding + Position Embedding
↓
┌─────────────────────────────────────┐
│ Transformer Block (重复N次) │
│ │
│ LayerNorm → Multi-Head Attention │
│ ↓ │
│ 残差连接 (+) │
│ ↓ │
│ LayerNorm → Feed-Forward Network │
│ ↓ │
│ 残差连接 (+) │
│ │
└─────────────────────────────────────┘
↓
Final LayerNorm
↓
线性层 → Softmax → 输出概率分布
【主流模型参数】
| 模型 | 层数 | 隐藏维度 | 注意力头 | 参数量 |
|---|---|---|---|---|
| GPT-2 Small | 12 | 768 | 12 | 117M |
| GPT-3 | 96 | 12288 | 96 | 175B |
| LLaMA-7B | 32 | 4096 | 32 | 7B |
| LLaMA-70B | 80 | 8192 | 64 | 70B |
| DeepSeek-V3 | 61 | 7168 | 128 | 671B |
九、本章心法总结
【口诀】
注意力机制心神合,多头千手观音身。
位置编码定时空,前馈网络内功深。
残差连接根基稳,层归一化功力纯。
【要点回顾】
| 组件 | 作用 | 关键点 |
|---|---|---|
| 自注意力 | 信息交互 | Q、K、V机制 |
| 多头注意力 | 多角度观察 | 并行多个注意力头 |
| 位置编码 | 时序信息 | RoPE是主流 |
| 前馈网络 | 信息变换 | 扩展-激活-压缩 |
| 残差连接 | 梯度传递 | 输出 = Layer(x) + x |
| 层归一化 | 训练稳定 | Pre-Norm更优 |
【下一章预告】
了解了Transformer架构后,下一章我们将学习规模法则(Scaling Laws),探索参数量、数据量、计算量之间的神秘关系。
更多推荐



所有评论(0)