别吹 Transformer 了,它其实就是个“注意力超强的翻译官“
别吹 Transformer 了,它其实就是个"注意力超强的翻译官"
说实话,我第一次看到"Transformer"这个词的时候,脑子里全是变形金刚。
擎天柱。大黄蜂。威震天。
后来才发现,这玩意儿比变形金刚厉害多了。
变形金刚只能变汽车,Transformer 变了整个 AI 行业。
先说个事
前两年,我有一次跟一个搞 AI 的朋友吃饭。
他跟我聊了半小时 Transformer,满嘴都是"多头注意力"、“位置编码”、“残差连接”。
我听得云里雾里。
后来我说了一句:“你能不能说得简单点?简单到一个高中没毕业的人都能听懂的那种。”
他沉默了大概五秒。
然后说:“呃……这个还真有点难。”
我说:“连你自己都讲不明白,说明你没真搞懂。”
这句话是费曼说的。一个物理学家。他说过一句话我到现在都记得:
如果你不能用简单的话把一个东西讲明白,说明你自己也没搞懂。
所以我今天就想干一件事:用最简单的话,把 Transformer 讲明白。
讲不明白,算我的。
Transformer 到底是干嘛的?
一句话:
它是个翻译官。
2017 年,Google 有八个研究员,写了一篇论文。论文标题很有意思,叫《Attention Is All You Need》。
翻译过来就是:注意力,就够了。别的都不需要。
这口气多大。
但人家确实做到了。
这篇论文出来之后,整个 AI 行业被翻了个底朝天。后来的 GPT、ChatGPT、文心一言、通义千问——全是基于它。
可以说,没有 Transformer,就没有今天这波 AI 浪潮。
八个默默无闻的研究员,凭一篇论文,改变了世界。
这大概是科技圈最浪漫的故事之一。
那"注意力"到底是什么?
别慌,我用一个你最熟悉的场景来解释。
你现在在看这篇文章。
你的眼睛扫过每一行字,但你不是每个字都花了同样的精力在看。
有些词你一扫而过,比如"的"、“了”、“是”。
有些词你会停下来多想一下,比如"注意力"、“翻译官”。
这就是注意力机制。
人天生就会的东西。
Transformer 做的事情,本质上跟你现在读这篇文章一模一样:
在一堆信息里,知道该看哪里。
就这么简单。
以前的翻译为什么不行?
在 Transformer 出来之前,做翻译用的是另一种技术,叫 RNN(循环神经网络)。
RNN 是怎么工作的?
一个字一个字地读。
从左到右,一个一个来。
你想想,如果让你一个字一个字地读一篇五千字的文章,读完最后一段的时候,你还记得第一段说了什么吗?
大概率不记得了。
RNN 也是这样。句子越长,它越记不住前面的内容。
翻译"我喜欢吃苹果"没问题。
翻译一篇长文章?前面说了什么,它基本忘了。
这个问题有个学名,叫"长距离依赖"。
说白了就是:前面的忘了,后面的没来,中间的还在迷路。
Transformer 怎么解决的?
它不一个字一个字读了。
它一眼看整句话。
然后它会问自己一个很聪明的题:
这句话里,哪些词跟哪些词有关系?
我举个具体的例子,你一听就懂。
英文原句:
“The animal didn’t cross the street because it was too tired.”
这里的"it"指的是谁?是 animal(动物),还是 street(街道)?
你一秒就能判断出来——当然是 animal,因为街道不会累。
Transformer 也会做同样的判断。它会让"it"和"animal"之间建立强关联,让"it"和"street"之间建立弱关联。
这个判断过程,就叫自注意力机制(Self-Attention)。
说白了就是:每个词都要看看别的词,搞清楚谁跟谁关系近。
你看,不是什么高深的东西。就像你读一句话的时候,会自然地把相关的词放在一起理解。
如果考试题问你 Transformer 的核心机制是什么,别犹豫,直接选这个:
自注意力机制(Self-Attention)。
或者更直白一点:"看重点"的能力。
记住这个。选别的都是给出题人送钱。
为什么说它比以前的厉害?
两个原因。
第一,不会忘。
以前的技术是"串行"的——一个字一个字看,看到后面忘了前面。
Transformer 是"并行"的——一眼看全部。
所有词同时处理,不存在"忘了前面"的问题。
第二,快得多。
并行计算比串行快得多,尤其在 GPU 上。
Google 那帮人做了一个实验:用 Transformer 做翻译,效果比以前最好的模型还要好一大截。
而且训练时间更短。
这就好比:你让一个人一个字一个字地校对一篇文章,和让八个人同时看八个段落——哪个快?
废话。
那它跟 ChatGPT 有什么关系?
关系太大了。
ChatGPT 用的 GPT 系列模型,底层就是 Transformer。
准确地说,是 Transformer 的"解码器"部分。
我来捋一下这条线:
2017 年,Google 发明了 Transformer,用来做翻译。
2018 年,OpenAI 拿过来改了改,用来生成文本。
然后就 GPT。
然后就有了 GPT-2、GPT-3、GPT-4。
然后就有了 ChatGPT。
然后就有了今天的 AI 热潮。
所以你现在用的那些 AI 工具,追根溯源,都来自 2017 年那篇论文。
八个研究员,一篇论文,改变了世界。
这种事,只有在科技行业才会发生。
说几个很多人搞错的点
第一个误区:Transformer 只能做翻译。
错。
现在它被用在图像、音频、视频、蛋白质结构预测……各个领域。
Vision Transformer 做图像分类,效果跟专门的图像识别模型一样好。
有些团队用它预测蛋白质怎么折叠。这是生物学里几十年没解决的大问题。
“万物皆可 Transformer”,这不是一句玩笑话。
第二个误区:Transformer 是完美的。
它也不是。
最大的问题:贵。
训练一个 GPT 级别的模型,需要几千张 GPU 跑几个星期。
电费和硬件成本加起来,几千万美元起步。
普通人根本跑不起。
而且它需要海量数据。数据不够,效果还不如小模型。
所以它很强,但不是万能的。
我想说的最后一件事
做科普这几年,我收到最多的私信就是:
“我零基础,能学 AI 吗?”
我的回答永远是:能。
但你要先搞懂最核心的东西。
Transformer 就是那个核心。
你不需要搞懂矩阵乘法怎么算,也不需要会写代码。
你只需要知道一件事:
Transformer 的核心思想,就是在一堆信息里,知道该看哪里。
就这么简单。
以后谁再跟你聊 Transformer,你就说:
“不就是个注意力超强的翻译官嘛。”
对方大概率会愣一下。
然后觉得你好像挺懂的。
行了,就写到这。
我是做 AI 科普的,目标只有一个:把复杂的东西用最通俗的话讲明白。
讲不明白,算我的。
有问题评论区见。
更多推荐
所有评论(0)