一边是硅谷叙事里永远的主角——Claude Code、Cursor、Devin;另一边,2026 年 7 月,几支中国团队用一份基准、一个终端工具、一套"会进化"的架构,悄悄把牌桌翻了过来。这不是"抄作业",这是有人开始"出题"了。


一、一个让西方安静下来的数字

2026 年 7 月,一份来自 OpenAI 的硬基准 PaperBench 上,出现了一个让整个 AI 编程圈不舒服的结果:

香港大学黄超团队开源的 DeepCode,得分 84.8%;Claude Code,58.7%。领先 26 个百分点。

更刺眼的是前一条:DeepCode 总体准确率 75.9%,首次超过了来自剑桥、伯克利等 8 所顶尖高校的机器学习博士(72.4%)。

PaperBench 不是那种"写个快速排序"的玩具题。它要求 Agent 从 20 篇 ICML 2024 论文的 PDF 出发,端到端复现出可运行的代码,评判维度是 8316 个独立可评分组件。换句话说,考的是"读懂前沿论文、把抽象数学变成能跑的系统"这种人类研究员都头疼的活。

这里有个决定胜负的关键细节,几乎被所有标题党忽略:对比时,双方用的都是当时最先进的底座模型。 Claude Code 跑的是 Claude 4.5 Sonnet-think,DeepCode 对比 GPT-5 codex-high 时也稳赢。也就是说,这 26 个百分点的差距,不是模型本身,而是架构设计

这正是本文要讲的核心:国产编程智能体的"逆袭",赢的从来不是"谁的底座更大",而是"谁先把 Agent 组织明白"。


二、两个"Deep Code",同一套哲学

有意思的是,就在这份基准刷屏的前后,DeepSeek 官方也推出了一款终端编程助手,名字叫 "Deep Code"(安装只需一行 npm install -g @vegamo/deepcode-cli)。

两个项目撞了同一个品牌名,不是巧合,是信号。它们共享同一套底层信念:编程 Agent 不该是"你问一句我答一句"的聊天框,而该是"你给目标,它自己翻完整个项目、改代码、装依赖、跑测试、提交 PR"的自主闭环。

DeepSeek 这套官方 Agent 的设计很能说明问题:

  • Goal 模式:开发者只设高层目标,Agent 自己拆解任务、编排执行顺序;
  • Workflow 模式:把跑通的成功路径固化成可复用模板——这是从"单次工具"向"持续参与开发的自动化成员"的关键一跃;
  • Plan / Agent / YOLO 三档:从"先请示"到"放手干"的信任梯度;
  • CodeGraph 代码图谱 + OCR 识别:让 Agent 真正"理解"项目结构,而不是只盯着你当前打开的那个文件发呆。

而 HKU 的 DeepCode,把这套哲学拆得更透明。它用的是三阶段多智能体框架

  1. 架构蓝图构建:把冗长文档切成块,概念智能体、算法智能体并行深挖,再由代码规划智能体融合成蓝图;
  1. 自动化代码构建:基于蓝图系统化搭仓库,专门解决"跨文件一致性"和"领域知识缺失";
  1. 动态验证与优化:静态分析 + 动态执行双重验证,形成自我完善的闭环反馈。

研究团队自己总结了一句值得裱起来的话:"对于复杂代码复现任务,复杂的代理支架(agent scaffold),比延长推理时间或更大的模型更重要。"

这句话,几乎是对过去两年"堆参数、拼上下文长度"路线的一记耳光。


三、真正的颠覆:会"进化"的 Agent

如果说 DeepCode / DeepSeek 解决的是"单次任务跑通",那么几乎同一天(2026-07-22)发布的 ToCodex v3.3.6,指向的是更吓人的方向——自学习、自进化 Agent

它给自己贴的标签是"全球首个通用型自学习自进化 Agent"。听着像营销词,但拆开看,逻辑是成立的。ToCodex 把开发者与 Agent 协作中产生的东西,沉淀成三类数字资产

  • 记忆资产:你和团队的稳定偏好与规则。比如你每次写 React 都用函数组件,Agent 记住,下次自动遵循;
  • 经验资产:任务中验证有效的方法。比如上次调一个微服务 bug 的某条排查路径特别管用,下次同类问题优先复用;
  • 工作流资产:把高频稳定操作整理成可复用方案。比如"构建—测试—部署"一键执行。

再加上向量语义召回——Agent 不只靠关键词,而是理解语义相似性,把历史决策、规则、上下文主动"喂"回新任务。这让记忆从"资料库"变成了"可被智能使用的上下文引擎"。

这套东西的威力在于一句话:它终结了"每次从零开始"。

过去所有 AI 编程工具的隐性成本,就是每次新会话都忘了上次学会了什么,开发者得一遍遍重新交代项目背景、重新踩一遍坑。ToCodex 的思路是:让 Agent 把踩过的坑变成排障经验,把重复劳动变成批处理 Skill,把团队协作变成可交接的资产。

这才是国产工具真正从"功能跟随"迈向"场景创新"的样本——西方在卷底座、卷上下文长度,中国团队开始卷"Agent 如何越用越懂你"这个更贴近真实工程的维度。

补充一句硬性参数,免得显得空:ToCodex 预装 26 家模型厂商的 API 协议、16 种 Agent 模式开箱即用,支持多厂商模型聚合、多 Agent 并行调度、移动端协同。它本质上是一个不绑定任何单一模型的"智能体操作系统"——这反而成了它在地缘不确定性下的护城河。


四、"逆袭"是真的,但别急着开香槟

写到这里,必须泼三盆冷水,否则这篇文章就沦为自嗨稿。

第一盆:基准的可比性还没坐实。 PaperBench 是个相对较新的基准,不同工具间的测试公平性、复现独立性仍需更多第三方验证。84.8% 很亮眼,但它目前更多来自单一团队的自报与学术评测,不是行业共识数字。

第二盆:"自进化"是把双刃剑。 过度套用旧经验,可能让 Agent 在变了味的场景里误判;"记住你的偏好"也可能把团队的坏习惯固化成铁律。复用的边界,需要真实长时间使用才能验证——营销稿不会告诉你这点。

第三盆,也是最狠的一盆:生态和分发,西方 still 领先一个身位。 Claude Code 年化收入一个季度从 25 亿美元冲到 80 亿美元,占 AI 编程市场约 54%;Devin 背后的 Cognition 估值 260 亿美元,且它自己代码库 89% 由 Devin 写成。中国团队在"能力点"上追平甚至反超,但在"谁定义了开发者的日常习惯"这场心智战争里,才刚起跑。

所以准确的判断是:国产 Agent 在"硬基准领先"和"架构创新"两个维度上实现了真正的逆袭,但在生态、分发、商业体量上仍是追赶者。 这不是贬低,而是把功劳记在它该记的地方。


五、这场逆袭,改写了什么规则

把三件事连起来看,你会发现它们共同推翻了一条旧假设:

旧假设:AI 编程的竞争 = 谁的底座模型更强。

新现实:AI 编程的竞争 = 谁把 Agent 组织得更好、谁让 Agent 学得更快。

DeepCode 用架构赢了模型;DeepSeek 把"目标编排 + 工作流固化"做成核心而非补丁;ToCodex 把"跨任务记忆与进化"变成产品。三者殊途同归——编程 Agent 的主战场,已经从"生成一行代码"转移到了"设计一组会协作、会积累、会自我修正的智能体"。

这恰好接上了 2026 年夏天另一条暗线:当 Loop Engineering 才火六周就被 Graph Engineering 取代,行业共识正在从"教 AI 怎么写"升级到"教 AI 怎么建规则、怎么协同、怎么不内耗"。而在这条新赛道上,中国团队不是旁观者,是共同定规则的人。

更值得玩味的是国产路径的独特性。西方 agent 大多绑定自家模型(Claude Code 绑 Claude,Codex 绑 GPT),ToCodex 却走"聚合 26 家厂商"的路线——在一个模型供给高度不确定、且对数据安全/本地化有强需求的市场里,这种"不站队、做编排层"的策略,反而可能是最硬的护城河。逆袭的底层,往往是适应了别人不适应的土壤。


六、结语:下一题,谁来出?

2026 年 7 月这批国产动作,意义不止于"又多了几个好用的工具"。它标志着一个微妙的权力转移:AI 编程的话语权,第一次不再由硅谷单方面定义。

但真正的好戏,在更前面一里地。

当 Agent 不仅能"自己写代码",还能"自己教自己"、把经验沉淀成数字资产,下一步必然是——Agent 之间开始互相训练、互相评审、在自我对弈中共同进步。到那时,"谁的 Agent 学得最快"会比"谁的模型最大"更决定胜负,而这场比赛的地理版图,会被重新画一遍。

DeepCode 用一份基准证明了中国团队能赢下硬仗,ToCodex 用一套记忆系统证明了中国团队能看到下一个拐点。剩下的,是把"能力逆袭"变成"生态逆袭"——那才是真正难、也真正值得写的下一章。

这一章的标题,已经不该叫"国产逆袭"了。该叫:当出题人不再只有一边。


数据来源:OpenAI PaperBench 基准、香港大学 HKUDS/DeepCode 开源项目(GitHub 约 8k Stars)、DeepSeek 官方 coding agent 发布信息、ToCodex v3.3.6 更新说明、华尔街见闻/腾讯新闻 AI 编程工具动态聚合(2026-07-22)、36 氪/新智元关于 DeepCode 的报道。文中基准对比均基于各工具配备当时最先进底座模

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐