Chapter 3: 大语言模型基础 Part 5:Decoder-Only 架构与 GPT 的崛起
基于Datawhale的hello-agent开源项目做的一些笔记,内容仅供参考,原PDF以及代码可以去github仓库获取https://datawhalechina.github.io/hello-agents
前几篇我们详细拆解了 Transformer 的 Encoder-Decoder 架构。本篇将探讨从 Transformer 到 GPT 的演变,以及支撑现代大模型的核心工作模式——自回归。
3.1.3 Decoder-Only 架构
前面一节中,我们动手构建了一个完整的 Transformer 模型。它的设计哲学是“先理解,再生成”:编码器负责深入理解输入的整个句子,解码器基于这份记忆来生成翻译。
但 OpenAI 在开发 GPT (Generative Pre-trained Transformer) 时,提出了一个更简单的思想 :语言的核心任务,不就是预测下一个最有可能出现的词吗?
无论是回答问题、写故事还是生成代码,本质上都是在一个已有的文本序列后面,一个词一个词地添加最合理的内容。基于这个思想,GPT 做了一个大胆的简化:它完全抛弃了编码器,只保留了解码器部分 这就是 Decoder-Only 架构的由来。
(1) 自回归 (Autoregressive) 工作模式
Decoder-Only 架构的工作模式被称为自回归。这个听起来很专业的术语,其实描述了一个非常简单的过程,就像在玩“文字接龙” :
-
输入:给模型一个起始文本(例如 “Datawhale Agent is”)。
-
预测:模型预测出下一个最有可能的词(例如 “a”)。
-
拼接:模型将自己刚刚生成的词 “a” 添加到输入文本的末尾,形成新的输入(“Datawhale Agent is a”)。
-
循环:模型基于这个新输入,再次预测下一个词(例如 “powerful”)。
-
终止:不断重复这个过程,直到生成完整的句子或达到停止条件。
(2) 掩码自注意力 (Masked Self-Attention)
你可能会问:解码器在训练时是能看到整个句子的,它是如何保证在预测第 ttt 个词时,不去“偷看”第 t+1t+1t+1 个词的答案呢?
答案就是 掩码自注意力 (Masked Self-Attention)。在 Decoder-Only 架构中,这个机制变得至关重要 。
工作原理:
在自注意力机制计算出注意力分数矩阵(QK^T)之后,但在进行 Softmax 归一化之前,模型会应用一个“掩码”:
-
这个掩码会将所有位于当前位置之后(即目前尚未观测到)的词元对应的分数,替换为一个非常大的负数(如 −∞-\infty−∞)。
-
当这个带有负无穷分数的矩阵经过 Softmax 函数时,这些未来的位置的概率就会变为 0。
💡 深度解析:
这种机制从数学上阻止了模型去关注它后面的信息。它确保了模型在预测下一个词时,能且仅能依赖它已经见过的、位于当前位置之前的所有信息,从而确保了预测的公平性和逻辑的连贯性 。
(3) Decoder-Only 架构的优势
这种看似简单的架构,却带来了巨大的成功,并成为如今 GPT-4、Llama 等主流大模型的标准范式。其优势在于 :
-
训练目标统一:模型的唯一任务就是“预测下一个词”。这个简单的目标非常适合在海量的无标注文本数据上进行预训练(Self-Supervised Learning)。
-
结构简单,易于扩展:更少的组件意味着更容易进行规模化扩展。今天的巨型模型(参数量达数千亿甚至万亿)都受益于这种简洁的架构。
-
天然适合生成任务:其自回归的工作模式与所有生成式任务(对话、写作、代码生成等)完美契合,这也是它能成为构建通用智能体基础的核心原因。
总而言之,从 Transformer 的解码器演变而来的 Decoder-Only 架构,通过“预测下一个词”这一简单的范式,开启了我们今天所处的大语言模型时代 。
更多推荐



所有评论(0)