过去两年,唱衰 AI 写代码成了一种政治正确。

“AI 生成的代码充满异味。”“Agent 把安全漏洞成倍灌进仓库。”“技术债务正在指数累积。”——这些话都对,但只说了一半。

2026 年春天,一份覆盖真实开源与商业仓库的大规模实证研究(alphaXiv 2603.28592,《Debt Behind the AI Boom》)扔出一个反直觉的结论:在“代码异味”这一项上,AI 助手修复的数量比它引入的多了 7069 个,是净负数。换句话说,AI 写代码这件事,在它最被诟病的“脏”的维度上,其实是净清洁工。

问题从来不是 AI 能不能写好代码。问题是:你有没有给它装上一个飞轮。


一、“脏”的真相:AI 修的比写的还多

先澄清一个被情绪掩盖的事实。

同一项研究把 AI 引入的问题分成三类:代码异味(占 89.3%)、正确性缺陷(6.0%)、安全漏洞(4.7%)。看起来触目惊心——但净值才是关键:

  • 代码异味:AI 净修复 7069 个,是净正面。
  • 安全漏洞:AI 引入了 1.5 倍于它修复的数量,净增 7342 个,是净负面。
  • 正确性:罕见但严重。

为什么“脏”反而被净清理?因为 Agent 最擅长做的,恰恰是人类最不愿意做的:补测试、跑 lint、统一命名、消除重复、把裸 except 改成精确捕获。这些“代码异味”的清理是高度模式化、低创造性的苦力活,人类会疲劳、会偷懒、会在 deadline 前跳过;而 Agent 不会。它不怕重复,不怕无聊,不嫌事小。

这解释了为什么 Devin(主打端到端自主的 Agent)每提交引入的问题最少(0.89/commit),而 Claude(介入更深、生成更多)每提交问题最多(1.95/commit)——不是模型优劣,而是“自主清理”与“辅助补全”的角色差异。Agent 一旦被授权“顺手把这片代码整理干净”,它就真的会整理。


二、飞轮的三个齿轮

把 AI 从“债务制造机”变成“质量飞轮”,靠的不是更聪明的模型,而是更对的循环。2026 年行业共识收敛到一套模式,Sonar 称之为 AC/DC(Agent-Centric Development Cycle,以 Agent 为中心的开发循环),核心是三个齿轮:引导(Bootstrap)、验证(Verify)、解决(Resolve)。

齿轮一:引导要克制。 直觉是往 Agent 上下文里狂塞风格指南、三年架构决策、入职文档,以为越全越好。但苏黎世联邦理工学院的研究泼了冷水:过大的上下文文件反而降低任务成功率,推理成本上升 20% 以上。经验法则——上下文控制在 200 行以内,只放代码中推不出来的基本信息,每个任务给具体上下文。引导的本质是“定向”,不是“倾倒”。

齿轮二:验证要内嵌。 最贵的错误是最后才验证:等 Agent 写完 200 行 PR,人类 reviewer 再从头审,高采用率团队 PR 合并量涨了 98%、审查时间涨了 91%——人已经被拖垮。飞轮的做法是在循环内部验证:单元测试、静态分析、安全扫描器的输出直接喂回 Agent,让它自己改。人跟不上 Agent 的节奏,原生 AI 工具专门为 Agent 调用而设计。

齿轮三:解决要分流。 简单子任务路由给便宜快的模型(Sonnet、Haiku),复杂推理留给 Opus——既降成本又保质量。这正是 2026 年 Q1 多 Agent 架构的“Per-Task Model Routing”范式。


三、一个更狠的多 Agent 形态:PBR

如果把单个 Agent 的循环放大成团队,就得到 2026 年生产环境最稳的模式:PBR(Plan → Build → Review,规划 → 构建 → 审查)

  • Planner 只写设计文档,不碰代码;
  • Builder 严格按文档实现;
  • Reviewer 冷读 diff,零先验上下文,专门找“幻觉导入”和“跳过的测试”。

单 prompt 单 Agent 在规模上必崩,但带角色隔离和人工检查点的结构化流水线能稳定产出。Sourcegraph 在 2026 年 3 月报告:其内部单体仓库 41% 的合并 PR 来自自主 Agent——不是 demo,是日常。


四、飞轮转起来的生产证据

数字比修辞诚实:

  • Nubank:一个横跨 600 万行 ETL 单体、涉及 1000+ 工程师、约 10 万处数据类实现的 18 个月迁移,用 Devin 在数周内完成,工程工时省 12 倍、成本降 20 倍。
  • Coinbase:用 Cursor 的 Agent 平台把“想法到生产”的时间压缩 90%。
  • Faire:用 Cursor Cloud Agents 把 PR 吞吐量翻倍。

这些不是玩具。它们是每天经手数十亿交易的公司。共同点:把“高度重复、定义清晰、结构一致”的苦力交给 Agent,把判断留给人类。飞轮转起来的地方,正是人类最痛的地方。


五、那个不能绕开的警告

乐观要有底气,也要有边界。

同一份研究也给出刺眼的数字:安全漏洞上 AI 是净负面(净增 7342),且 AI 引入的问题有 22.7% 的“存活率”——截至 2026 年初,超 10 万个 AI 引入的问题仍悬在代码库里没修。人类 reviewer 的“审查疲劳”和“过度信任”让小异味和隐蔽漏洞溜进去,成了永久 fixture。

但注意:这恰恰是飞轮要修的东西。安全净负面,是因为多数团队把 Agent 当“补全”用、最后才扫;一旦把安全扫描器塞进循环内部(验证齿轮),净负面就能被扳回。飞轮不是安慰剂,它是把“最后才查”变成“边写边查”的工程纪律。


六、人类剩下的是什么

The Stack Stories 一针见血:自主 Agent 取代的是“写语法”那部分工作。剩下的——决定建什么、接受什么权衡、判断结果对不对——反而更值钱。

Vercel、Linear、Anthropic 的资深工程师现在大部分时间在审 Agent 的输出,而不是自己写。新技能变成三件事:写密集的规格(spec)、设计 Agent 能对着迭代的测试夹具、识别某类模型特有的失败形态。

这不是失业,这是升维。


结语

唱衰 AI 写代码的人,犯了一个方向性错误:他们盯着每一次提交的瑕疵,却没看见飞轮转起来后的累计清洁量。

AI 不会自动让软件变好——裸用的 Agent 确实在灌债务。但一旦你给它装上引导、内嵌验证、分流解决的循环,它就会变成历史上第一个永不疲倦、不厌细小、不 chasing deadline 的代码园丁。

烂代码不会消失。但第一次,我们有了一个能持续修剪它的机器。质量飞轮转不转,不取决于模型,取决于你有没有给它装齿轮。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐