第四章:神功初成——Transformer之架构

注意力机制心神合,多头千手观音身。

在这里插入图片描述

【本章导读】

2017年,谷歌门派发表论文《Attention Is All You Need》,Transformer架构横空出世,如九阳神功现世,彻底改变了AI武学格局。本章将深入剖析这一革命性架构。


一、Transformer横空出世

【历史背景】

2017年之前,AI武学以RNN、LSTM为主流。这些功法虽有效,但存在致命缺陷:

  • 时序依赖:必须按顺序处理,无法并行
  • 长程遗忘:序列太长时,前面信息被遗忘
  • 训练缓慢:计算效率低下

【Transformer之优势】

特性 RNN/LSTM Transformer
并行计算
长程依赖
训练速度
可扩展性

二、整体架构:天人合一

【架构总览】

Transformer由**编码器(Encoder)解码器(Decoder)**两部分组成:

┌─────────────────────────────────────────────────────────────┐
│                    Transformer架构                           │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│   输入 ──→ [编码器] ──→ 编码表示 ──→ [解码器] ──→ 输出       │
│                                                             │
│   编码器: 理解输入,提取特征                                  │
│   解码器: 生成输出,逐词预测                                  │
│                                                             │
└─────────────────────────────────────────────────────────────┘

【三种架构变体】

变体 结构 应用 代表模型
Encoder-only 仅编码器 理解任务(分类、抽取) BERT
Decoder-only 仅解码器 生成任务(对话、写作) GPT系列
Encoder-Decoder 完整结构 序列到序列(翻译、摘要) T5

大语言模型(LLM)主要采用Decoder-only架构。


三、注意力机制:心神合一

【注意力心法】

注意力机制是Transformer的核心,如同武学中的"心神合一"——能够聚焦于关键信息,忽略无关内容。

【Query、Key、Value】

自注意力使用三个概念:

概念 武学比喻 作用
Query(查询) 心神所向 当前关注的目标
Key(键) 招式特征 用于匹配的信息
Value(值) 招式内涵 实际传递的信息

【注意力计算】

输入序列 X
    ↓
线性变换得到 Q, K, V
    ↓
注意力权重 = softmax(QK^T / √d_k)
    ↓
输出 = 注意力权重 × V

【图解注意力】

输入: "大模型修炼秘籍"

处理"修炼"时:
┌──────────────────────────────────────┐
│  Query: "修炼"在问什么?              │
│                                      │
│  Keys:                               │
│    "大" → 0.1 (相关性低)             │
│    "模型" → 0.3 (有一定相关)          │
│    "修炼" → 0.4 (自身最相关)          │
│    "秘籍" → 0.2 (相关)                │
│                                      │
│  注意力权重: [0.1, 0.3, 0.4, 0.2]     │
│                                      │
│  输出 = 加权求和                      │
└──────────────────────────────────────┘

【数学公式】

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) VAttention(Q,K,V)=softmax(dk QKT)V


四、多头注意力:千手观音

【多头心法】

单头注意力只能学习一种关系模式。多头注意力如同千手观音,从多个角度同时观察,捕捉不同类型的关系。

【多头注意力结构】

输入 X
    ↓
┌─────────┬─────────┬─────────┬─────────┐
│ Head 1  │ Head 2  │ Head 3  │  ...    │
│ (Q1,K1,V1)│ (Q2,K2,V2)│ (Q3,K3,V3)│         │
└────┬────┴────┬────┴────┬────┴─────────┘
     ↓         ↓         ↓
  注意力1   注意力2   注意力3
     └─────────┴─────────┘
              ↓
         Concat拼接
              ↓
         线性变换
              ↓
           输出

【多头的意义】

不同头学习不同的关系:

可能学习的关系
Head 1 语法关系(主谓宾)
Head 2 语义关系(同义词)
Head 3 指代关系(代词指代)
Head 4 位置关系(相邻词)

五、位置编码:时空定位

【位置编码心法】

Transformer本身没有时序概念,无法区分"我爱你"和"你爱我"。位置编码为每个位置添加唯一标识,让模型知道Token的顺序。

【旋转位置编码(RoPE)】

现代大模型(如LLaMA、DeepSeek)使用旋转位置编码:

优点:

  • 更好地捕捉相对位置关系
  • 长度外推能力更强
  • 计算效率高

六、前馈网络:内功修炼

【FFN结构】

输入 (d_model)
    ↓
线性层1: d_model → 4*d_model (扩展)
    ↓
激活函数 (GELU/SwiGLU)
    ↓
线性层2: 4*d_model → d_model (压缩)
    ↓
输出

【激活函数】

激活函数 使用模型
ReLU 早期模型
GELU BERT、GPT
SwiGLU LLaMA、DeepSeek

七、残差连接与层归一化:稳固根基

【残差连接】

输出 = Layer(x) + x

武学比喻: 如同修炼中保留根基,在原有功力基础上叠加新能力,而非完全替换。

【Pre-Norm vs Post-Norm】

方式 结构 使用
Post-Norm Layer + Norm BERT
Pre-Norm Norm + Layer GPT-2+、LLaMA

现代大模型普遍采用Pre-Norm。


八、Transformer完整结构

【Decoder-Only Transformer】

输入Token序列
    ↓
Token Embedding + Position Embedding
    ↓
┌─────────────────────────────────────┐
│ Transformer Block (重复N次)          │
│                                     │
│   LayerNorm → Multi-Head Attention  │
│        ↓                            │
│   残差连接 (+)                       │
│        ↓                            │
│   LayerNorm → Feed-Forward Network  │
│        ↓                            │
│   残差连接 (+)                       │
│                                     │
└─────────────────────────────────────┘
    ↓
Final LayerNorm
    ↓
线性层 → Softmax → 输出概率分布

【主流模型参数】

模型 层数 隐藏维度 注意力头 参数量
GPT-2 Small 12 768 12 117M
GPT-3 96 12288 96 175B
LLaMA-7B 32 4096 32 7B
LLaMA-70B 80 8192 64 70B
DeepSeek-V3 61 7168 128 671B

九、本章心法总结

【口诀】

注意力机制心神合,多头千手观音身。
位置编码定时空,前馈网络内功深。
残差连接根基稳,层归一化功力纯。

【要点回顾】

组件 作用 关键点
自注意力 信息交互 Q、K、V机制
多头注意力 多角度观察 并行多个注意力头
位置编码 时序信息 RoPE是主流
前馈网络 信息变换 扩展-激活-压缩
残差连接 梯度传递 输出 = Layer(x) + x
层归一化 训练稳定 Pre-Norm更优

【下一章预告】

了解了Transformer架构后,下一章我们将学习规模法则(Scaling Laws),探索参数量、数据量、计算量之间的神秘关系。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐