基于Datawhale的hello-agent开源项目做的一些笔记,内容仅供参考,原PDF以及代码可以去github仓库获取https://datawhalechina.github.io/hello-agents
前几篇我们详细拆解了 Transformer 的 Encoder-Decoder 架构。本篇将探讨从 Transformer 到 GPT 的演变,以及支撑现代大模型的核心工作模式——自回归。

3.1.3 Decoder-Only 架构

前面一节中,我们动手构建了一个完整的 Transformer 模型。它的设计哲学是“先理解,再生成”:编码器负责深入理解输入的整个句子,解码器基于这份记忆来生成翻译。

但 OpenAI 在开发 GPT (Generative Pre-trained Transformer) 时,提出了一个更简单的思想 :语言的核心任务,不就是预测下一个最有可能出现的词吗?

无论是回答问题、写故事还是生成代码,本质上都是在一个已有的文本序列后面,一个词一个词地添加最合理的内容。基于这个思想,GPT 做了一个大胆的简化:它完全抛弃了编码器,只保留了解码器部分 这就是 Decoder-Only 架构的由来。

(1) 自回归 (Autoregressive) 工作模式

Decoder-Only 架构的工作模式被称为自回归。这个听起来很专业的术语,其实描述了一个非常简单的过程,就像在玩“文字接龙” :

  1. 输入:给模型一个起始文本(例如 “Datawhale Agent is”)。

  2. 预测:模型预测出下一个最有可能的词(例如 “a”)。

  3. 拼接:模型将自己刚刚生成的词 “a” 添加到输入文本的末尾,形成新的输入(“Datawhale Agent is a”)。

  4. 循环:模型基于这个新输入,再次预测下一个词(例如 “powerful”)。

  5. 终止:不断重复这个过程,直到生成完整的句子或达到停止条件。

(2) 掩码自注意力 (Masked Self-Attention)

你可能会问:解码器在训练时是能看到整个句子的,它是如何保证在预测第 ttt 个词时,不去“偷看”第 t+1t+1t+1 个词的答案呢?

答案就是 掩码自注意力 (Masked Self-Attention)。在 Decoder-Only 架构中,这个机制变得至关重要 。

工作原理:
在自注意力机制计算出注意力分数矩阵(QK^T)之后,但在进行 Softmax 归一化之前,模型会应用一个“掩码”:

  • 这个掩码会将所有位于当前位置之后(即目前尚未观测到)的词元对应的分数,替换为一个非常大的负数(如 −∞-\infty)。

  • 当这个带有负无穷分数的矩阵经过 Softmax 函数时,这些未来的位置的概率就会变为 0

💡 深度解析:

这种机制从数学上阻止了模型去关注它后面的信息。它确保了模型在预测下一个词时,能且仅能依赖它已经见过的、位于当前位置之前的所有信息,从而确保了预测的公平性和逻辑的连贯性 。

(3) Decoder-Only 架构的优势

这种看似简单的架构,却带来了巨大的成功,并成为如今 GPT-4、Llama 等主流大模型的标准范式。其优势在于 :

  • 训练目标统一:模型的唯一任务就是“预测下一个词”。这个简单的目标非常适合在海量的无标注文本数据上进行预训练(Self-Supervised Learning)。

  • 结构简单,易于扩展:更少的组件意味着更容易进行规模化扩展。今天的巨型模型(参数量达数千亿甚至万亿)都受益于这种简洁的架构。

  • 天然适合生成任务:其自回归的工作模式与所有生成式任务(对话、写作、代码生成等)完美契合,这也是它能成为构建通用智能体基础的核心原因。

总而言之,从 Transformer 的解码器演变而来的 Decoder-Only 架构,通过“预测下一个词”这一简单的范式,开启了我们今天所处的大语言模型时代 。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐