Claude Code 自己写了 5 小时代码,我全程没碰键盘

3 种角色、5 个 Agent、1 套自我纠错闭环。Claude Code 稳定跑了 5 个小时,21 个模块全部交付。提示词全开源。


不是"做一个 PPT",是"跑一个工程"

表面看是 21 个视频分镜文件。本质上是一个多模块、有质量门禁、能自我修复的工程项目

每页模块要经过三道质检(布局/美观/动画),查出问题自动打回去修,修完再检,最多三轮。21 个模块 × 最多 4 轮开发 × 3 维测试 = 一个不小的工程。

单靠一个 AI?上下文干三四页就爆了。于是有了这套流水线——

总览:

启动

一次性

逐批

设计指南

你(人类)

主调度(大管家)

规划师
出设计指南+计划

开发测试循环
(每批独立,最多3轮)

开发测试循环展开:

FAIL

全PASS

提交

报告路径

三道质检(并行)

布局

美观

动画

程序员
出草稿

判定

通过,下一批

核心就三条规矩:

角色 能干嘛 不能干嘛
大管家 派活、看 PASS/FAIL、记日志 不读代码、不读报告正文
程序员 读指南→写代码→自检→提交 不碰测试报告以外的东西
质检员×3 读代码→审查→写报告 绝不碰输出文件

最绝的一招:Resume

Claude Code 的子 Agent 有个隐藏特性:可以通过一个内部 ID,让它"接着上次聊"。也就是说,程序员修 bug 的时候,脑子里还记着它写代码时的思路——不需要你跟它重新解释一遍。

问题是怎么拿到这个 ID?官方没给直接接口。我们搞了个土办法:

探测文件系统 → 找到最新 agent 的元数据文件 → 抠出裸 ID

然后用这个 ID 叫它回来接着干活。

实测:一个页面来回修了 3 次,程序员的上下文从 1.5 万 token 涨到 6.2 万——它不是每次重来,而是越修越懂这个页面

反过来,质检员每次都是全新启动。为什么?新眼睛没有惯性,不会因为"上次看过这里没问题"就跳过去。

程序员 质检员
模式 Resume(有记忆) 每批新启动(无记忆)
像什么 老工匠,越做越熟 新人,永远警觉
上下文 1.5万→6.2万 token 每次从零开始

经验库:犯了错别白犯

程序员每次修完 bug,必须写一条经验到 lessons-learned.md。但有三条"入档标准":

  • ❌ “page14 的阶梯图 CSS class 要通用” → 换项目就没用了

  • ✅ “可复用的视觉组件用通用 class 名” → 换项目照样生效

  • ❌ “把 padding 从 20px 改成 16px” → 记了个值而已

  • ✅ “flex column + height:100% + 居中 = 大面积空白” → 记的是模式

三条标准:

  1. 写为什么错,不写改了什么值
  2. 写哪种模式容易错,不写哪个页面错了
  3. 换了下个项目还有用吗? 没用就别记

新来的程序员开工前第一件事:读 lessons-learned.md。page01 踩的坑,page05 不会再踩——这就是自动免疫


人发现 bug → 教会 AI → 再也不会漏

这是我们跑出来的最漂亮的循环:

又发现新bug

第1步
你打开页面
'这页上下空太多了吧'

第2步
F12看CSS
height:100% + center = 悬空

第3步
把检测规则写进Skill
M0零容忍/M1溢出/M2高度/M3间距

第4步
以后所有页面自动被拦
你再也不用盯这个bug了

你每发现一个 bug,不是修掉就完了,而是把它变成质检员的一项永久技能。 Skill 文件就是技能载体。你的审查能力在往 AI 身上"复制"。


监控面板:一眼看清谁在跑

每步追加一行JSON

每5秒读取

浏览器打开

主调度

flow-log.jsonl

monitor.html
纯静态页面

实时看:
谁在跑 / Resume几次
上下文多大 / 花了多少token

主调度和监控面板完全解耦——只靠一个 JSON 文件约定字段名。换了调度系统,监控照样用。

bash serve-monitor.sh    # 就一行,python -m http.server
# → http://localhost:8888/monitor.html

好钢用在刀刃上:模型怎么配

5 个 Agent,傻傻全用最强模型?那钱包要哭。

不同的活,配不同档位的模型:

用 Opus(最强,贵) 用 Haiku(够用,便宜)
规划师:一次性任务,要深度思考 布局质检:规则匹配,不烧脑
程序员:写代码,要质量 美观质检:按 checklist 打分
动画质检:算时间差,小学数学

账怎么算:

一个页面跑一轮:程序员(Opus)约 1.5 万 token,质检 ×3(Haiku)约 3K×3=9K token。如果质检也用 Opus,多花 3-5 倍的钱,结果一样。

质检员的活是"有没有命中反模式?颜色对不对?间距差几 px?"——这些是规则判断,不需要推理能力。Haiku 完全够用,而且跑得更快。

能省多少? 21 页做下来,三个质检员如果全用 Opus,成本大概翻 4 倍。省下来的钱够再做一个项目。

原则一句话:需要创造/决策的用 Opus,需要对照清单检查的用 Haiku。


几个你没注意到的设计心思

1. "大管家不读内容"有多重要?

如果大管家读完测试报告再转述给程序员,同一份内容塞进了两个 Agent 的上下文——大管家先炸,转述的内容再炸程序员。

只传文件路径: 质检员写报告 → 程序员自己读报告。谁需要谁读,不搞传话。

❌ 大管家读报告→转述→程序员(同一份内容,占两份上下文)

✅ 质检员写报告→程序员直接读(一份内容,一份上下文)

2. 不信任架构 = 质量保障

FAIL:打回去修

不能做的事

不能做的事

不能做的事

程序员
写代码

质检员
找茬

大管家
判PASS/FAIL

说自己过了

改代码

替程序员改代码

  • 程序员不能说自己过了 —— 必须质检员说了算
  • 质检员不能改代码 —— 必须程序员来修
  • 大管家不能替程序员改 —— 必须程序员自己来

任何一个人越权,闭环就破了。

3. 上下文窗口的"选品策略"

进程序员上下文 不进
设计指南(怎么做) 素材原文(传路径就行)
之前踩过的坑 测试报告(用的时候再读)
自己写的 CSS 结构 其他页面的内容

精打细算——上下文窗口是很贵的,每一 kb 都得问一句"真的需要吗?"


直接拿走的文件

全在 GitHub:github.com/STEPHENXING/multi-agent-in-cc

文件 干嘛的 你能怎么用
AGENTS.md 大管家的大脑,16 条铁律 换你的项目,改页面结构就行
.claude/agents/*.md 5 个 Agent 定义(约100行/个) 直接复用角色分工
.claude/skills/*.md 5 个审查 Skill 单独用也行——让任意 Claude 按这个标准查质量
monitor.html 实时监控面板 纯静态,零依赖
serve-monitor.sh 一行启动 webserver python -m http.server 而已

拿走改成你自己的项目

这套框架虽然是为"分镜制作"这个场景设计的,但三角色模型、Resume 机制、经验库——跟具体产出物没关系,是通用的。

你要改什么

假设你要做一个代码审查系统(程序员写代码,质检员查 bug):

要改的(业务相关) 不用动的(框架层)
Agent 定义里的"干什么" 三角色分工结构
Skill 里的审查标准 Resume 机制 + ID 获取方式
AGENTS.md 里的页面概念 flow-log 监控体系
lessons-learned 的领域 经验库的过滤原则

三步改完

第 1 步:换 Agent 定义

.claude/agents/ 下的 5 个文件:

  • dg-planner.md → 你的规划师要读什么、产出什么
  • dg-slide-dev.md → 你的程序员用什么工具、怎么写代码
  • dg-slide-tester-*.md → 你的质检员查什么维度、用什么 skill

只改 “触发场景” 和 “工作流程” 部分,工具列表、模型选择保留。

第 2 步:换 Skill

.claude/skills/ 下的审查 skill:原来是检查 padding、颜色、动画间距,改成检查你的质量标准(代码规范?安全漏洞?API 设计?)。

M0-M3 的思路保留——把你最常发现的 bug 写成"零容忍规则"。

第 3 步:换 AGENTS.md 里的业务词

全文替换:

  • “幻灯片” → 你的产出物
  • “page” → 你的任务单元
  • “index.html(输出主文件)” → 你的产出物文件名

流程结构(Plan → Dev → Test → Fix)不用动。

偷懒起步

git clone https://github.com/STEPHENXING/multi-agent-in-cc.git your-project
cd your-project

# 1. 删掉幻灯片相关的 Skill 内容,换成你的
# 2. 改 .claude/agents/*.md 里的角色描述
# 3. 把 AGENTS.md 里的 "page" 换成你的任务单元
# 4. 开干:
"读 AGENTS.md。我的项目是 {你的项目描述},开始做第一批。"

核心骨架(Agent 分工、Resume、经验库、监控)——不动。只换外面的"皮"。


说到底

5 个小时,21 个模块,0 次手动改代码。Claude Code 自己在跑——规划、开发、检查、修 bug、再检查。我只做了两件事:定流程,和发现 bug 后把它写成规则塞进 tester 脑子里

这不是"AI 写了个 PPT"。这是你用流程设计了一套能自我纠错的生产线,然后它自己转了 5 个小时

想复用这套东西做你自己的项目,记住两件事:

  1. Agent 之间怎么传递信息(传路径,不传内容)
  2. 出了错怎么发现、怎么修(tester 不能改、dev 不能判、主调度只认 PASS/FAIL)

想清楚这两点,剩下的让它跑。


全部代码和提示词:github.com/STEPHENXING/multi-agent-in-cc

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐