【词汇专栏】Transformer:AI 大模型的“通用引擎“
·
Transformer:AI 大模型的"通用引擎"
当你用 ChatGPT 聊天、让 AI 画画、听 AI 写歌的时候,背后运转的都是同一个"引擎"——Transformer。它是 2017 年以来几乎所有 AI 突破的起点。
一句话定义
Transformer 是一种基于自注意力(Self-Attention)机制的深度学习架构,于2017年由 Google 团队提出,彻底取代了 RNN/LSTM,成为当今几乎所有大模型的基石。
为什么叫 Transformer?
“Transformer” 直译是"变换器"——它通过"变换"输入数据中的信息来实现理解:
输入一段话 → Transformer 变换处理 → 输出理解后的结果
这个"变换"不是简单的规则替换,而是通过注意力机制自动学习
哪些信息重要、哪些不重要,然后重新"组织"信息
它解决了什么问题?
在 Transformer 出现之前,处理序列数据(文字、语音)的主流方法是 RNN 和 LSTM:
RNN/LSTM 的工作方式(逐词处理):
"我" → LSTM → "爱" → LSTM → "中" → LSTM → "国"
↑
每次只能处理一个词
必须等前一个词处理完
→ 无法并行计算,训练很慢
→ 长文本容易"忘记"开头的信息
Transformer 的革命性改进:一次性看到所有内容:
Transformer 的工作方式(并行处理):
"我" "爱" "中" "国"
↓ ↓ ↓ ↓
┌─────────────┐
│ 同时处理所有词 │
│ 每个词都能直接 │
│ 关注其他所有词 │
└─────────────┘
↓
并行计算,速度快几百倍
长文本也不会遗忘
核心机制:自注意力(Self-Attention)
自注意力是 Transformer 的"灵魂",用一句话概括:
让每个词都能直接"看到"句子中的所有其他词,并决定每个词对自己有多重要。
通俗类比:读一句话时的"关注"
句子:"苹果公司发布了一款新手机,它的价格让很多人感到惊讶。"
人类读到"它"的时候,自动知道"它"指的是"手机"——
因为你的"注意力"集中在"手机"上,而不是"苹果公司"
自注意力机制做的就是这个:
"它"这个词会计算和句子中每个词的"注意力分数":
"它" ↔ "苹果公司" → 0.1
"它" ↔ "发布" → 0.05
"它" ↔ "手机" → 0.6 ← 最高,"它"最关注"手机"
"它" ↔ "价格" → 0.2
"它" ↔ "惊讶" → 0.05
Q、K、V 三把钥匙
自注意力的计算可以用"三把钥匙"来理解:
每个词有三个向量:
Q(Query,查询)= "我在找什么信息?"
K(Key,钥匙) = "我有什么信息?"
V(Value,值) = "我的实际内容是什么?"
计算过程:
对于每个词的 Q,和其他所有词的 K 做匹配(点积)
→ 得到注意力分数(哪些词和我最相关)
→ 用分数对 V 做加权求和(融合相关信息)
类比:
你去图书馆找书:
Q = 你的搜索需求
K = 每本书的标题/关键词
V = 每本书的内容
→ 匹配 Q 和 K → 找到相关书籍 → 提取 V 中的信息
多头注意力:从多个角度理解
单头注意力:每个词只有一组 Q、K、V
→ 只能从一种角度理解关系
多头注意力:每个词有多组 Q、K、V(比如8组)
→ 头1:关注语法关系(主语-谓语)
→ 头2:关注语义关系(同义词)
→ 头3:关注位置关系(相邻的词)
→ ...
→ 综合多个角度的理解 → 更全面的语义把握
Transformer 的完整架构
┌──────────────────────────────────────────┐
│ Transformer │
│ │
│ ┌────────────┐ ┌────────────────┐ │
│ │ 编码器 │ │ 解码器 │ │
│ │ Encoder │ │ Decoder │ │
│ │ (理解输入) │ │ (生成输出) │ │
│ │ │ │ │ │
│ │ ×6层 │ │ ×6层 │ │
│ │ 每层: │ │ 每层: │ │
│ │ 1.自注意力│ │ 1.自注意力 │ │
│ │ 2.前馈网络│ │ 2.交叉注意力 │ │
│ │ 3.残差+LN│ │ 3.前馈网络 │ │
│ └────────────┘ │ 4.残差+LN │ │
│ ↑ └────────────────┘ │
│ │ ↑ │
│ │ │ │
│ 输入序列 输出序列 │
└──────────────────────────────────────────┘
注意:现代大模型通常只用解码器(GPT系列)或只用编码器(BERT),
不需要完整的编码器-解码器结构。
基于 Transformer 的著名模型
| 模型 | 年份 | 类型 | 说明 |
|---|---|---|---|
| BERT | 2018 | 仅编码器 | 双向理解,擅长分类和问答 |
| GPT系列 | 2018+ | 仅解码器 | 单向生成,ChatGPT 的基础 |
| T5 | 2019 | 完整 | 编码器+解码器,Google 的通用模型 |
| ViT | 2020 | 编码器 | 把 Transformer 用在图像上 |
| Whisper | 2022 | 完整 | 语音识别(本专栏 P10) |
| LLaMA | 2023 | 解码器 | Meta 开源大模型(本专栏 P05) |
| GPT-4o | 2024 | 解码器 | 多模态旗舰 |
| DeepSeek-R1 | 2025 | 解码器 | 强化学习推理(本专栏 P07) |
一句话:2017年之后的所有主流 AI 模型,都是 Transformer。
Transformer 的局限
| 局限 | 说明 |
|---|---|
| O(n²) 复杂度 | 序列越长,计算量二次方增长,处理超长文本代价高 |
| 位置编码 | Transformer 本身不感知顺序,需要额外的位置编码来告诉它"词的顺序" |
| 固定上下文窗口 | 窗口外的信息会被截断(虽然现在已有扩展方案) |
这些局限催生了新的架构探索,如本专栏 P11 介绍的 Mamba。
一句话总结
Transformer 用"自注意力"这一优雅的机制,让 AI 模型能够同时看到所有信息并自主决定关注重点。它是 2017 年以来 AI 领域每一项重大突破的底层引擎——没有 Transformer,就没有 GPT、没有 ChatGPT、没有今天你所看到的 AI 革命。
延伸阅读
- 论文解读 P01:《Attention Is All You Need》精读 —— Transformer 的原始论文
- 论文解读 P02:BERT —— 基于 Transformer 编码器的里程碑
- 论文解读 P11:Mamba —— Transformer 的挑战者
标签:#AI术语 #Transformer #自注意力 #深度学习 #大模型 #GPT #BERT
更多推荐



所有评论(0)