模型没动,Agent却强了19个百分点:微软在GPT-5.5外面套了一层「企业管理层」
GPT-5.5 直接修 Bug,SWE-Bench Pro 上的准确率是 59%。
同一个模型,换了一个运行框架,准确率跳到了 78%。
这个运行框架叫 Argus,来自微软研究院和上海交大联合团队,8 月 5 日刚发布。它没有微调模型参数,没有换更强的 backbone——它做了一件更底层的事:给 Agent 装了一套公司治理结构。
过去两年,Agent 领域的主流思路是「让模型更强」。但 Argus 团队问了一个反直觉的问题:如果问题不在模型,而在模型之外呢?
你让一个 AI Agent 帮你重构 Spring Boot 项目。它改了一堆代码,跑到一半发现之前的方案行不通。怎么办?
普通 Agent 硬着头皮继续——上下文窗口已经被之前的操作填满,没地方记「这条路错了」,更没法把教训传给下一次任务。
长周期 Agent 的根本困境:没有组织记忆。
Argus 的方案听上去简单到荒谬——像开公司一样运营 Agent。
四张工牌:干活的和验收的,不是同一个人
Argus 把 Agent 拆成了四个角色。每个角色有不同的权限、不同的责任,只有自己那摊事能做。
Manager 掌握最终目标。不写代码,只守住最初的目的,决定什么时候该调头。
Planner 把目标拆成可执行的小任务。只规划,不执行。
Engineer 干活的人。关键约束:做完不能自己拍板说「好了」。
Reviewer 独立质检员。三种裁决权:「通过」「重做」「堵死了」。
这四个角色的分工解决了一个关键问题——做的人和验收的人,不能是同一个人。
你在公司里不会让程序员自己给自己 Code Review。但今天的 AI Agent,绝大多数都是「自己检查自己」——模型先写代码,然后模型自己判断写得对不对。短任务勉强能混,长任务一拉就崩。
Argus 把这条线划死了。
731 次 SWE-Bench Pro 任务中,466 次(63.7%)调用了独立的 Reviewer。43 个任务被 Reviewer 打回去重做,其中 34 个最终通过了外部验证器,22 个走完了「重做→再审查→通过」的完整回路。换算一下:每 100 个被 Reviewer 拦截的任务里,79% 是真的有问题的,不是 Reviewer 过于严格。
还有 35 个任务被直接标记为「阻塞」——Reviewer 认为在当前条件下不可能完成。
这是一个很少有人谈的问题:一个好的 Agent 系统,应该知道什么时候该说「我做不到」。 承认阻塞比瞎编一个结果有价值得多——Argus 在这一点上的诚实,本身就是工程上的进步。
跑了 731 个任务后,Token 自己省了 21%
Argus 最颠覆认知的数据在这——
成熟期(第 19-22 波任务)相比启动期(第 1-6 波),Token 消耗下降 21%,运行时间下降 15%。
模型权重没变。GPT-5.5 还是那个 GPT-5.5。变的是「公司知识库」。
跑过的代码库结构被存下来了,成功的修复模式被存下来了,验证过的死胡同被标记了「勿入」,哪些任务需要调用 Reviewer、哪些可以让 Engineer 自己检查——这些路由决策也被记录和优化了。
这就像老员工比新人效率高,不是因为智商更高,而是因为「这个坑不用再踩一次」。
Argus 管这个过程叫「验证门控的运行时自进化」。翻译成大白话:经验只有经过 Review 确认有效,才能变成可复用的知识。
不是每次执行都会产生可复用的经验。有些任务是死胡同,跑了也是白跑。有些输出被 Reviewer 驳回,自然也进不了知识库。只有那些「被验证过的有效状态更新」才会进入持久存储。
这个设计的反向约束同样重要——不进知识库的东西,不会污染下一次任务。
常规 Agent 的上下文窗口像个越来越长的聊天记录。前面犯的错、走的弯路、无效的尝试,全堆在里面。模型要从垃圾堆里翻出有价值的信息,Token 越烧越多,效果却越来越差。
Argus 的解决方案很直接:每次任务给干净的上下文窗口,需要的背景知识从持久化知识库按需读取。知识库里的东西都是审核过的,不会被无效信息污染。每一轮模型调用都是「干净的起点 + 精选的背景」。
这框架不只写代码,它还造了芯片
如果 SWE-Bench Pro 只证明 Argus 能写代码,那下面这些数据说明它是一个通用研究引擎。
芯片设计:Argus 独立完成了推理加速芯片 ACE-2 的 RTL 设计、验证环境搭建、综合和静态时序分析,能端到端跑 Qwen2.5-0.5B。人类没有参与一行 RTL。
材料科学:Argus 发现已发表 MOF 论文的评分函数是错的——实际主要失败模式不是原子重叠而是不充分配位。它设计了新评分函数(AUC 0.594→0.833),然后进一步发现论文改进效果其实来自积分器切换。最终用更简单的 best-of-K 方法超越了已发表的复杂方法。
论文生产:六条完整的论文流水线,涵盖评估可靠性、视觉-语言匹配、测试时自适应、GUI Agent、多模态幻觉、模型量化六个方向。总计 640 个 campaign 小时,254 次 bounded mission,576 次 Engineer 执行轮次,286 次 Reviewer 修订,16 次 Stage 回滚。六个项目全部走到终稿提交阶段。
Kaggle 竞赛:MLE-Bench Lite 上拿到 9 块奖牌,3 金 3 银 3 铜。
开源贡献:Argus 优化的 TileLang RWKV6 内核,被 Moonshot AI 的 Flash Linear Attention 仓库合并进了主线。
同一套 Manager-Planner-Engineer-Reviewer 机制,不改一行架构代码,在软件工程、芯片设计、材料科学、数学证明四个完全不同的领域都能产出有价值的成果。
你现在就能做的三件事
Argus 的意义不在技术本身。它在揭示一个被忽视的方向——
过去两年所有人都在卷模型能力,但 Agent 的瓶颈可能不在模型,在「组织」。 一个 100 人的公司如果管理混乱,换更强的员工没用。Agent 系统如果执行和审核不分家、任务之间不共享知识、失败经验不沉淀——换更强的模型也只是多烧 Token。
这个思路不需要出一个开源框架才能用。你现在就能做三件事:
第一,把「做」和「审」分开。 用两个独立调用的模型,上下文完全隔离。审核模型只看产出物和验证标准,不允许自审自过。
第二,建一个「已验证经验库」。 走通的路和走不通的路都记下来。重点是「为什么这条路走不通」——这个比成功方案更值钱。下次执行新任务,先从经验库读相关内容。
第三,给 Agent 定一个「我做不到」的出口。 设定明确的阻塞条件(连续 3 次 Review 不通过、关键依赖缺失),让 Agent 主动报阻塞而非瞎编。承认跑不通,比硬跑出一个错的结果对你的信任伤害小得多。
Microsoft Research × Shanghai Jiao Tong University. Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning. arXiv:2608.05144, August 2026.
本文首发于「圈圈的AI工程笔记」
更多推荐



所有评论(0)