别吹 Transformer 了,它其实就是个"注意力超强的翻译官"

说实话,我第一次看到"Transformer"这个词的时候,脑子里全是变形金刚。

擎天柱。大黄蜂。威震天。

后来才发现,这玩意儿比变形金刚厉害多了。

变形金刚只能变汽车,Transformer 变了整个 AI 行业。

先说个事

前两年,我有一次跟一个搞 AI 的朋友吃饭。

他跟我聊了半小时 Transformer,满嘴都是"多头注意力"、“位置编码”、“残差连接”。

我听得云里雾里。

后来我说了一句:“你能不能说得简单点?简单到一个高中没毕业的人都能听懂的那种。”

他沉默了大概五秒。

然后说:“呃……这个还真有点难。”

我说:“连你自己都讲不明白,说明你没真搞懂。”

这句话是费曼说的。一个物理学家。他说过一句话我到现在都记得:

如果你不能用简单的话把一个东西讲明白,说明你自己也没搞懂。

所以我今天就想干一件事:用最简单的话,把 Transformer 讲明白。

讲不明白,算我的。

Transformer 到底是干嘛的?

一句话:

它是个翻译官。

2017 年,Google 有八个研究员,写了一篇论文。论文标题很有意思,叫《Attention Is All You Need》。

翻译过来就是:注意力,就够了。别的都不需要。

这口气多大。

但人家确实做到了。

这篇论文出来之后,整个 AI 行业被翻了个底朝天。后来的 GPT、ChatGPT、文心一言、通义千问——全是基于它。

可以说,没有 Transformer,就没有今天这波 AI 浪潮。

八个默默无闻的研究员,凭一篇论文,改变了世界。

这大概是科技圈最浪漫的故事之一。

那"注意力"到底是什么?

别慌,我用一个你最熟悉的场景来解释。

你现在在看这篇文章。

你的眼睛扫过每一行字,但你不是每个字都花了同样的精力在看。

有些词你一扫而过,比如"的"、“了”、“是”。

有些词你会停下来多想一下,比如"注意力"、“翻译官”。

这就是注意力机制。

人天生就会的东西。

Transformer 做的事情,本质上跟你现在读这篇文章一模一样:

在一堆信息里,知道该看哪里。

就这么简单。

以前的翻译为什么不行?

在 Transformer 出来之前,做翻译用的是另一种技术,叫 RNN(循环神经网络)。

RNN 是怎么工作的?

一个字一个字地读。

从左到右,一个一个来。

你想想,如果让你一个字一个字地读一篇五千字的文章,读完最后一段的时候,你还记得第一段说了什么吗?

大概率不记得了。

RNN 也是这样。句子越长,它越记不住前面的内容。

翻译"我喜欢吃苹果"没问题。

翻译一篇长文章?前面说了什么,它基本忘了。

这个问题有个学名,叫"长距离依赖"。

说白了就是:前面的忘了,后面的没来,中间的还在迷路。

Transformer 怎么解决的?

它不一个字一个字读了。

它一眼看整句话。

然后它会问自己一个很聪明的题:

这句话里,哪些词跟哪些词有关系?

我举个具体的例子,你一听就懂。

英文原句:

“The animal didn’t cross the street because it was too tired.”

这里的"it"指的是谁?是 animal(动物),还是 street(街道)?

你一秒就能判断出来——当然是 animal,因为街道不会累。

Transformer 也会做同样的判断。它会让"it"和"animal"之间建立强关联,让"it"和"street"之间建立弱关联。

这个判断过程,就叫自注意力机制(Self-Attention)。

说白了就是:每个词都要看看别的词,搞清楚谁跟谁关系近。

你看,不是什么高深的东西。就像你读一句话的时候,会自然地把相关的词放在一起理解。

如果考试题问你 Transformer 的核心机制是什么,别犹豫,直接选这个:

自注意力机制(Self-Attention)。

或者更直白一点:"看重点"的能力。

记住这个。选别的都是给出题人送钱。

为什么说它比以前的厉害?

两个原因。

第一,不会忘。

以前的技术是"串行"的——一个字一个字看,看到后面忘了前面。

Transformer 是"并行"的——一眼看全部。

所有词同时处理,不存在"忘了前面"的问题。

第二,快得多。

并行计算比串行快得多,尤其在 GPU 上。

Google 那帮人做了一个实验:用 Transformer 做翻译,效果比以前最好的模型还要好一大截。

而且训练时间更短。

这就好比:你让一个人一个字一个字地校对一篇文章,和让八个人同时看八个段落——哪个快?

废话。

那它跟 ChatGPT 有什么关系?

关系太大了。

ChatGPT 用的 GPT 系列模型,底层就是 Transformer。

准确地说,是 Transformer 的"解码器"部分。

我来捋一下这条线:

2017 年,Google 发明了 Transformer,用来做翻译。

2018 年,OpenAI 拿过来改了改,用来生成文本。

然后就 GPT。

然后就有了 GPT-2、GPT-3、GPT-4。

然后就有了 ChatGPT。

然后就有了今天的 AI 热潮。

所以你现在用的那些 AI 工具,追根溯源,都来自 2017 年那篇论文。

八个研究员,一篇论文,改变了世界。

这种事,只有在科技行业才会发生。

说几个很多人搞错的点

第一个误区:Transformer 只能做翻译。

错。

现在它被用在图像、音频、视频、蛋白质结构预测……各个领域。

Vision Transformer 做图像分类,效果跟专门的图像识别模型一样好。

有些团队用它预测蛋白质怎么折叠。这是生物学里几十年没解决的大问题。

“万物皆可 Transformer”,这不是一句玩笑话。

第二个误区:Transformer 是完美的。

它也不是。

最大的问题:贵。

训练一个 GPT 级别的模型,需要几千张 GPU 跑几个星期。

电费和硬件成本加起来,几千万美元起步。

普通人根本跑不起。

而且它需要海量数据。数据不够,效果还不如小模型。

所以它很强,但不是万能的。

我想说的最后一件事

做科普这几年,我收到最多的私信就是:

“我零基础,能学 AI 吗?”

我的回答永远是:能。

但你要先搞懂最核心的东西。

Transformer 就是那个核心。

你不需要搞懂矩阵乘法怎么算,也不需要会写代码。

你只需要知道一件事:

Transformer 的核心思想,就是在一堆信息里,知道该看哪里。

就这么简单。

以后谁再跟你聊 Transformer,你就说:

“不就是个注意力超强的翻译官嘛。”

对方大概率会愣一下。

然后觉得你好像挺懂的。

行了,就写到这。

我是做 AI 科普的,目标只有一个:把复杂的东西用最通俗的话讲明白。

讲不明白,算我的。

有问题评论区见。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐