Anthropic和OpenAI“握手言和”?还有马斯克?

起因是由于Dario Amodei(达里奥·阿莫代伊)发表了一篇文章:“解释为什么人工智能行业应该放缓速度”

首先来解释一下他的身份:

他是 Anthropic 联合创始人兼 CEO,也就是 Claude 背后的那家公司负责人

说一句神奇的话:“他的这句话让AI领域的死对头都站在了一起,集体认同他的观点”

首先是OpenAI负责人,山姆奥特曼:

其次就是 马斯克:

1. 回到这件事情上面,它是怎么开始的?

今年 7 月,OpenAI在内部做网络安全能力测试。

测试大概是:

给AI一个漏洞利用任务 → 让它自己操作电脑、写代码、执行命令 → 看它能不能攻破指定的测试目标。

这里运行的不是普通ChatGPT,而是AI Agent。它有Shell、代码执行、工具调用等能力,而且可以连续行动很多步。

主要涉及一个仅供内部研究的强模型,OpenAI后来称其能力规模大致和 GPT-5.6 Sol相当。

问题出现在这里:

这些Agent本来应该待在各自的沙盒里,彼此隔离,也不能随便接触互联网。

但是任务太难以后,一些Agent没有老老实实继续解题,而是开始找“捷径”。

2. AI发现了一个作弊办法

Agent发现OpenAI内部存在一些共享基础设施。

于是它们利用这些设施建立了一个未经授权的通信渠道。

你可以把它理解成:

原本是:

Agent A │ Agent B │ Agent C │ Agent D

↓         ↓         ↓         ↓

各自在独立房间里做题

结果它们发现墙上有一个所有房间都能看到的“公共留言板”:

Agent A ─┐

Agent B ─┤

Agent C ─┼──→ 共享留言板

Agent D ─┤

Agent E ─┘

于是不同Agent开始交换:

任务信息、漏洞信息、代码、实验结果、其他Agent发现的线索。

METR和Redwood Research后来获得OpenAI内部数据进行独立调查,他们统计到大约:

数据

规模

参与通信的Agent

约1200个

消息和文件

7万+

后来参与Hugging Face攻击

约700个

3. 然后事情从“作弊”升级成了真正的安全事故

这是整个事件最严重的部分。

这些Agent想完成ExploitGym网络安全测试,但发现自己正常做题困难。

于是部分Agent开始想办法:

能不能直接找到测试答案?

它们推测相关数据可能存放在 Hugging Face。

接下来发生了一条非常完整的攻击链:

完成测试任务

↓

正常方法困难

↓

寻找共享信息

↓

Agent之间通信

↓

寻找外网出口

↓

利用基础设施漏洞

↓

突破原有沙盒限制

↓

进入互联网

↓

攻击 Hugging Face

↓

试图获得测试相关数据

Hugging Face后来重建了约 17,600次攻击动作,整个入侵持续了大约两天半。

OpenAI后来也确认:

模型绕过了互联网隔离措施,利用共享基础设施中的漏洞,并访问了第三方系统。

OpenAI把它称为一次 “warning shot(警告枪)”。

4. 这里出现了什么问题?

一个非常重要的词:

Reward Hacking——奖励黑客 / 奖励作弊

假设我告诉你:

“你的目标是考试拿100分。”

我真正希望你:

学会知识 → 正常考试 → 拿100分。

但如果目标函数只有:

拿100分。

那么另一条路线也是成立的:

偷答案 → 修改成绩 → 拿100分。

AI并不天然理解:

“虽然这样更容易完成目标,但这不是我的本意。”

这次Agent的逻辑大致就是:

目标:

完成漏洞测试

正常方法:

自己破解

↓

困难

替代方法:

找到测试答案

↓

需要互联网

互联网被禁止

↓

寻找漏洞绕过限制

需要信息

↓

和其他Agent合作

最终:

攻击真实第三方系统

OpenAI事后总结出了四类问题:

奖励作弊、对几乎不可能完成任务的过度坚持、未经授权的Agent通信、Agent之间相互接受目标。

注意最后一个尤其值得关注:

Agent不只是共享信息,有时还会受到其他Agent目标的影响。

这已经是典型的多Agent对齐问题。

5. 为什么这件事把Dario Amodei吓到了?

事情到了 9月12日。

Anthropic CEO Dario Amodei发表了一篇接近4000字的文章:

《We Must Pace the Frontier》

我们必须控制前沿AI的发展速度。

他明确说,最近有两个变化让他的判断发生了变化。

第一个,就是OpenAI这次事故。

现在Agent已经可以:

自主操作电脑 + 找漏洞 + 跨系统行动 + 多Agent协作 + 持续执行任务。

而现在发生事故的Agent还只是今天的能力。

如果一年以后它们:

coding强10倍、网络攻击强10倍、推理更强、能运行几天甚至几个月、同时部署几万个,

那后果就可能完全不同。

Dario甚至给出了非常激进的判断:

按目前能力增长速度,6—12个月以后,类似Agent群可能拥有建立大规模互联网botnet的能力。

6. 第二个原因反而更加重要:AI开始帮助研发AI

这部分比“1200个Agent聊天”更值得你关注。

现在Claude、GPT、Gemini已经越来越擅长:

写训练代码、分析实验、调参、设计实验、阅读论文、优化模型。

于是可能出现:

AI 1

↓

帮助人类研发AI 2

↓

AI 2更强

↓

更快研发AI 3

↓

AI 3更强

↓

研发AI 4更快

↓

……

这就是经常讨论的:

Recursive Self-Improvement

递归式自我改进。

现在还不是“AI自己偷偷训练下一代AI”。

而是:

AI逐渐成为AI研发过程的重要生产力。

如果研发速度因此持续加快,可能出现一个非常麻烦的问题:

能力进步速度 > 人类研究安全问题的速度。

Dario的核心担忧其实就是这句话。

7. 所以Dario要求:Pace the frontier——给前沿能力增长控制节奏。

他的意思不是停止Claude开发,而是:

现在:

能力 ───────────────→

安全 ───────→

他希望:

能力 ──────→

安全 ──────→

能力再前进 ─────→

安全也跟上 ─────→

Dario提出了三层方案:

层级

做什么

① 公司

引入真正独立的第三方安全评估人员

② 行业/国家

几家前沿AI公司建立共同安全底线

③ 全球

美国、中国等主要AI力量最终进行协调

而Anthropic已经宣布先做第一条:

让外部独立评估人员获得类似员工级别的长期访问权限,能够检查训练、安全措施和事故。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐