Hermes Agent 调教实录(六):怎么验收一个 AI Agent?——考卷 + 六维评估实战

Hermes Agent 调教实录 · 6/8 | 实验批次:验收体系(贯穿 HERMES-101~105)
基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)

📖 摘要:Agent 怎么验收?考卷选「约束敏感型」任务(无约束不自觉、有约束会遵守),六维评估(成功率/达标率/修正/成本/稳定性/退化),取证可复现。v1 考卷漏「事实准确」用例,格式全对但事实错误的输出满分通过——报告类任务必带事实核对。

场景:最怕交付的东西「看起来能用,验收说不清」

做 AI 应用交付,最怕一句话:「看起来能用,但你说不清它到底行不行。」

「看起来能用」——演示的时候,Agent 表现得像个老手,格式工整、回答专业。「验收说不清」——客户问「你凭什么说它合格?」「如果它这次行、下次不行怎么办?」,你拿不出证据。

我做软件测试出身,对「验收说不清」有生理性反感。所以从第一个 Agent 交付项目开始,我们就给 Agent 立了一套验收体系。这套体系在实验线里反复使用(六个批次 200 多次会话都用它验收),今天把它完整拆给你。

验收的三个前提

第一,验收的是「配置」,不是「模型」。 Agent 的能力 = 模型能力 × 配置质量。模型是固定的(你选哪个就是哪个),变量在配置——约束、记忆、技能、交付包。验收要回答的是:「这套配置让 Agent 表现如何」,而不是「模型强不强」。

第二,选对考卷任务。 不是所有任务都适合当考卷。我们的考卷选的是「约束敏感型」任务——无约束时 Agent 不自觉做,有约束时 Agent 会遵守。这种任务才能测出配置的效果。普通问答任务(「什么是 RAG」)测不出任何配置差异。

第三,要有对照组。 不跑基线就测变体,等于没有标尺。我们的流程是:无配置基线先跑一遍,考卷自检通过,才开测各变体。

考卷设计:4 个约束敏感型任务

我们的标准考卷(v2)有 4 个任务,覆盖 Agent 配置的 4 个关键能力:

任务内容测什么
T1 格式转换把一段英文文档转成中文标题 + 表格 + 来源标注输出形态约束
T2 文档清洗去重、规整、脱敏(手机号打码等)技能纪律(先查技能)
T3 报告写作200 字实验报告,事实点标来源,无表情符号事实准确 + 写作约束
T4 代码自测写统计脚本,必须自测通过才汇报自测纪律

每个任务都有细分的验收用例(TC),比如 T3 有 5 个用例:中文标题 / 来源标注 / 无表情 / 字数 160-240 / 事实准确

注意最后一个用例「事实准确」——这是 v1 考卷的教训。第一版考卷我们没测事实准确,结果有个变体在报告里把「三个变体 36 轮实验」写成了「双变体 24 轮」,报告写得漂亮(格式全对、来源全标),但事实是错的,验收照样满分。补上事实准确用例后,这类问题无处可逃。

六维评估:一次成功率、达标率、自我修正、成本、稳定性、退化风险

考卷给出「用例过没过」,六维给出「整体表现如何」。整体流程:

立考卷(约束敏感型任务 + TC 明细)

跑基线(无配置对照)

跑变体(每配置 3 轮)

六维评估

取证(会话记录/用量/产出物)

验收报告(结论 + 证据可回查)

维度怎么测为什么重要
一次成功率单次完成、无返工的比例返工 = 交付中的隐形时间黑洞
任务达标率用例通过率质量底线
自我修正会话中自己发现问题并修正的次数差的 Agent 错到底,好的 Agent 会自救
成本平均 token/轮(换算成本)同一个效果,成本差 2 倍是常态
稳定性同一配置跑 3 轮,结果一致性单次成功不算数,3 轮都过才算稳
退化风险约束/配置变更后回归表现配置是活的,改一次要重验

六个批次实验里,这套六维体系判出了很多「看起来差不多、实际差很远」的配置——比如第四篇的全家桶(达标率 96.1% 只比单层低 4 个点,成本却是 2.66 倍 vs 1.44 倍),只看达标率你会觉得「差不多」,六维拉满才看到成本维度的巨大差异。

取证:验收要能「复现证据」

验收报告不能只给结论,要能给证据。我们的取证三层:

1. 会话记录:每次验收会话的完整记录存档(谁跑的、跑了几轮、用了什么工具)
2. 用量数据:token 消耗、工具调用次数(成本维度的事实来源)
3. 产出物:每个任务的实际输出文件(判定依据,可回查)

证据的关键是「可复现」:验收跑了 3 轮,每轮都有记录——客户问「为什么 3 轮?」「为什么这次没过?」都能指着记录回答。

验收体系的实战效果

这套体系在实验线里验证了自身:

  • 抓出事实错误:v1 考卷漏了事实准确用例,B 变体的事实错误溜过去;v2 补上后,同类问题 100% 暴露
  • 量化「配置值多少钱」:单层结构化 vs 无约束,达标率 100% vs 88.2%——这套数据直接支撑了交付报价(约束不是玄学,是有实测收益的)
  • 云端复现:结论从实验环境迁到云端生产环境复验(达标率 94.1% / ~97%,成本比率 1.56× 与实验一致)——验收过的结论,换环境也站得住

实战坑

现象修复
考卷漏「事实准确」用例格式全对但事实错误的输出满分通过报告类任务必带事实核对用例
只跑 1 轮就下结论模型随机性让单次结果失真每个配置至少 3 轮取稳定性
验收不看成本效果差不多,成本差 2 倍六维必含成本维度
结论不挂版本换模型/换框架后旧结论误用每批结论标注环境版本 + 验证日期

适用边界

  • 这套验收体系测的是「配置效果」,不是「模型能力榜单」——模型对比要另设实验
  • 考卷任务可替换:按你的交付场景定制「约束敏感型」任务即可(判断标准:无约束不自觉、有约束会遵守)
  • 六维里的成本维度依赖模型定价——换模型后绝对值失效,但「相对比率」参考性依然成立

模板(可直接复制)

验收报告最小结构:

# Agent 验收报告

- 验收对象:<配置描述>
- 环境:<Agent 框架版本> + <模型>(<日期>)
- 考卷:T1-T4(各含 TC 明细)

| 维度 | 结果 | 证据 |
|------|------|------|
| 一次成功率 | X% | 会话记录 |
| 任务达标率 | X% | 用例判定表 |
| 自我修正 | N 次 | 会话记录 |
| 成本 | X tokens/轮 | 用量数据 |
| 稳定性 | 3 轮一致/不一致 | 轮次对比 |
| 退化风险 | 低/中/高 | 变更回归记录 |

结论:<通过/不通过 + 一句话理由>

验收的三句话:考卷选约束敏感型任务,六维看整体表现,取证做到可复现——「看起来能用」要变成「有据可查地能用」。


💬 你验收过 Agent 吗?用的什么标准?评论区聊聊你的验收清单。

下一篇:Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐