AI静待变革(上)——大语言模型三大致命缺陷(有更新)
梁敬彬梁敬弘兄弟出品
引言
当大语言模型(LLM)的热度高到能“烫伤”现实,当整个世界都在为其疯狂之时,人工智能领域的泰斗、“强化学习之父”——理查德·萨顿(Rich Sutton),却平静地投下了一枚深水炸弹。
当被问及对LLM的看法时,Sutton直言不讳:“大语言模型是通往通用人工智能(AGI)的死路一条 (a dead end)。”
这句话,像一道刺眼的闪电,瞬间劈开了喧嚣的赞美声,精准地击中了我内心那片模糊的不安。它照亮了LLM华丽外表下,那深刻的、结构性的局限。
Sutton的核心论点是什么?一言以蔽之:
“强化学习是关于理解你的世界,而大语言模型是关于模仿人类说的话。他们不是在搞清楚该做什么,只是在模仿该说什么。”(Reinforcement
learning is about understanding your world, and large language models
are about imitating people saying what people say you should do. They
are not figuring out what to do.)
基于这个核心,他条分缕析地指出了LLM存在的三大致命缺陷。今天,我想试着把这种“豁然开朗”的感受,与大家分享。
1. 命门一:鹦鹉学舌,而非理解
Sutton的第一个论断就是,LLM缺乏真正的世界模型(World Model)。
它看似博学,能解释万物,但Sutton一语道破其本质:“模仿人类说什么并不是在建立真正的世界模型,只是在模仿那些拥有世界模型的东西,也就是人类。”
这句话是什么意思?
Sutton解释说,这里有一个关键的差异:预测人类会说什么,和预测世界会发生什么,是完全不同的两件事情。
他举了一个生活中的例子:你看到一个孩子要伸手去碰一个滚烫的热水壶。你脑中的“世界模型”会立刻让你预测出“手碰到水壶会发生烫伤”这个物理后果,于是你会立刻行动去阻止。
但LLM呢?它被投喂了海量的文本数据,它知道当人类看到这个场景时,会说什么。所以它会生成“别碰,会烫!”这样的文字。
你看,区别就在这里。你是在预测一个物理世界的因果,而它,是在预测一个文本世界的序列。它本身根本不理解“热水壶”和“烫伤”这些概念的物理意义,也不知道“碰”这个动作和“烫伤”这个结果之间的因果关系。它只是在极其精妙地复制人类的语言模式,而没有真正理解世界的运作逻辑。
这就像一个演员,可以通过模仿,完美地扮演一个医生,说出所有专业的医学术语,做出所有逼真的手术动作。但他终究不是医生,因为他脑中没有那个关于人体运行机理的、真正的“世界模型”。
这就是LLM的第一个致命缺陷,也是最根本的缺陷:它构建的,是一个语言模型,而非一个世界模型。

2. 命门二:没有对错,只有好恶
Sutton指出的第二个致命缺陷,同样犀利:大语言模型没有客观的真实标准(Ground Truth)。
他还说:
“在大型模型中没有正确答案的定义。你说了什么,但是你不会得到关于什么是正确的反馈,因为根本就没有什么正确的定义。”(In large
language models, there’s no definition of what is a correct answer.
You say something, but you don’t get feedback about what is correct
because there’s no definition of what is correct.)
这句话,是理解LLM局限性的钥匙。
想象一个AI玩打砖块的游戏。它的“Ground Truth”非常明确:打掉砖块,得分;没接住球,游戏结束。系统能通过清晰、客观、即时的反馈,知道自己的上一个动作是对是错,并以此调整策略,越玩越好。
但LLM生成文本时,有这样的“Ground Truth”吗?比如,你让它写一篇关于“如何提升专注力”的文章。它洋洋洒洒写出几千字后,我们能给它一个“+10分”或“-5分”的客观反馈吗?
不能!因为“如何提升专注力”这件事,本身就没有唯一的、标准的正确答案。你无法提供一个可供验证的反馈信号来告诉LLM:“你这里写得不好,该改。”
既然没有一个客观的、关于对错的判断标准,系统就无法进行真正的学习和改进。
我们可能会通过RHLF(人类反馈强化学习)来“告诉”它我们更喜欢哪个答案,但这更像是在进行一种“品味”的校准,而非基于客观事实的修正。LLM依然不知道自己究竟“错”在哪里,它只是知道要更迎合人类的偏好。
这就像一个学生,作业老师不打分,也不划对错,只是模糊地说“感觉还不错”或者“差点意思”。那么这个学生,可能永远也无法真正搞清楚知识点,也无法取得实质性的进步。
这就是LLM的第二个致命缺陷:在一个没有客观对错标准(Ground Truth)的世界里,它所谓的“学习”,更像是一种“迎合”,而非“求真”。

3. 命门三:活在过去,不识意外
Sutton提出的第三个致命缺陷:大语言模型无法从实时的经验中学习。
他强调:
“他们不会对接下来发生的事情感到惊讶。如果发生了意外,他们也不会做出调整。”(They are not surprised by what
happens next. They do not adjust if something unexpected happens.)
这一点,精准地击中了当前AI的核心痛点。人类乃至所有动物的学习,本质上都是通过“预期”与“现实”之间的偏差(也就是“意外”或“惊喜”)来调整和深化认知的。
你以为今天会下雨,带了伞,结果晴空万里。这个“意外”,就会让你下次在判断天气时,更加审慎地看待天气预报。但LLM没有这种适应性。
一个有趣的例子:你问LLM,“把冰块放进微波炉加热会怎么样?”基于它读过的所有文本,它会自信地回答:“冰块会融化。”这是基于训练数据的预测。
但是,如果你真的动手做这个实验,发现因为微波炉功率太低,冰块在里面转了半个小时都几乎没变化。这个“意外”发生了。你会怎么做?你会立刻更新你的认知:“哦,原来微波炉加热冰块的效率这么低。”
那LLM呢?它不会。它不会因为这个真实发生的意外,而改变自己的认知。下次你再问它同样的问题,它还是会机械地回答:“冰块会融化。”
为什么?因为它没有“身体”去亲自做这个实验,它没有“感官”去观察实验结果,它更没有一个机制,能让这个“意外”的现实,去修正它那基于历史文本的“旧知识”。它根本没有体验“经验”的能力,只是在被动地处理文本输入。
这就是LLM的第三个致命缺陷:它是一个活在“过去”的、静态的知识库。它无法被“现实”所修正,也无法被“意外”所启发,因此,它无法获得真正的、持续的成长。

4. 期待中:死路已现,活路何在
Sutton提出LLM的这三个致命缺陷,并非是要全盘否定其当下的巨大价值。但他的批判,如同三记重锤,砸开了我们对LLM的盲目崇拜,让我们看到了其华丽外表下那深刻的、结构性的局限。
而故事,还远未结束。
在指出了这条“死路”之后,Sutton在访谈中,用更长的时间,描绘了他心中那条通往AGI的真正路径——“经验学习范式”。他详细阐述了一个完整智能体(Agent)必须具备的四大核心组件,深入探讨了为何“理解松鼠就能理解人类智能”,甚至从宇宙演化的宏大视角,提出了关于“AI继承论”、“设计时代”等一系列颠覆性的、令人深思的观点。
这些更深远的洞察,都指向了一个问题:我们是否正在全力以赴地攀爬一棵看起来很高大,但其实没有根系的“AI大树”?
关于Sutton描绘的那条真正的AGI未来之路,我们下集再聊。静待变革,敬请期待…
未完待续…
系列回顾
更多推荐



所有评论(0)