Hermes Agent 调教实录(七):AI Agent 配置七条铁律——200 次实验的结论汇总

Hermes Agent 调教实录 · 7/8 | 实验批次:HERMES-101~105 + 云端复现(汇总)
基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)

📖 摘要:200 多次实验的结论汇总成七条铁律:结构化约束、纪律进身份、记忆粗粒度、触发词精准窄、小技能单文件大技能拆 refs、约束有甜点区、验收用考卷+六维。每条带实测数据和适用边界,可直接复制使用。

为什么要有「铁律」

六篇文章,六个主题:约束、记忆、技能、交付包、多轮、验收。每篇都有实验数据、都有适用边界——但真到交付现场,你不会带着六篇文章干活。你需要的是几条能直接用的判断。

所以最后一篇,把 200 多次对照实验的结论压成七条铁律。每条都带「为什么」和「什么时候不适用」——铁律不是教条,是有边界的经验。

七条铁律

铁律一:结构化约束 > 裸铁律

内容:约束文件写成分节 + 纪律表格(要求/禁止成对),不要写一句话铁律。

数据:结构化写法达标率 100%、成本 1.44×;裸铁律达标率 96.1%、成本 2.28×,还出过事实错误。

为什么:只写要求不写禁止,Agent 会把要求「字面执行」成过度行为。

不适用:任务极简单(无纪律要求)时,两种写法没差别。

铁律二:纪律放身份层,信息放记忆层

内容:行为纪律(先查技能/写完自测)写进身份文件(SOUL),环境事实/偏好写进记忆(MEMORY)。

数据:同一条「先加载技能」,身份文件触发 3/3,记忆文件只触发 1-2/3。

为什么:记忆是「参考信息」,身份是「自我要求」——Agent 对两者的执行强度完全不同。

不适用:一次性任务(不跨会话)时,记忆层纪律的弱触发影响不大。

铁律三:记忆默认粗粒度,细节按需补

内容:记忆先写 5 条左右一句话偏好,不要一上来写 10 条分类细节。

数据:粗粒度记忆成本 0.80×(比不写还省),细结构化 1.24× 只换来 +4% 达标率。

为什么:粗粒度给了方向感减少探索,细粒度在一般任务上边际收益递减。

不适用:高度依赖具体规范的任务(行业术语/字段规范),细粒度必要。

铁律四:触发词精准窄,技能名当门面

内容:技能描述只写真实场景触发词;技能命名要直观表达能力。

数据:宽触发词让弱相关任务 3/3 误加载;模糊描述挡不住正主加载(技能名本身就是信号)。

为什么:Agent 先看「技能名 + 描述」决定加载与否——误加载浪费上下文,命名差则正主也不加载。

不适用:技能库很小(<10 个)时,误加载成本可接受。

铁律五:小技能单文件,大技能拆 refs

内容:≤25KB 技能全写一个文件;>50KB 拆成骨架 + 细节文件。

数据:1.4KB 技能拆 refs 成本 1.29×(负优化);77KB 大技能拆 refs 省 13.5% 输入 token(58.5k → 50.6k)。

为什么:小技能拆了多一次加载往返;大技能单文件一次加载不完要反复读。

不适用:25-50KB 的技能按内容形态判断(查表型拆、方法论留)。

铁律六:约束有甜点区,交付包按形态选配

内容:约束 1-2 层结构化是甜点(1.4-1.7×,100% 达标);全家桶过载(2.66×,纪律稀释)。交付按形态分档:多轮配纪律层 + 记忆,单轮配全套。

数据:单层结构化 1.44×/100%;三层组合 1.66×/100%;四层全家桶 2.66×/96.1%。

为什么:约束本质是上下文指令,指令越多注意力越分散,层间还可能冲突。

不适用:客户明确要求全配置矩阵时(极少数合规场景),过载成本要提前报给客户。

铁律七:验收用考卷 + 六维 + 取证

内容:考卷选约束敏感型任务;六维评估(一次成功率/达标率/自我修正/成本/稳定性/退化风险);证据可复现。

数据:v1 考卷漏「事实准确」用例,事实错误输出满分通过;v2 补上后 100% 暴露。云端复现确认结论跨环境可迁移(达标率 94.1% / ~97% 一致)。

为什么:没有验收 = 没有「合格」的定义,交付说不清。

不适用:纯内部实验(不对外交付)时,验收可以简化到只跑考卷。

结论汇总表

配置决策的总入口,一张图:

多轮对话(IM 接入)

单轮自动化

交付一个 Agent

交付形态?

纪律层 + 记忆(输出靠对话)

全套(纪律 + 输出格式)

技能层(1-2 个,精准触发词)

验收(考卷 + 六维 + 取证)

达标?

交付(版本锁定)

按铁律 1-6 定位修复

#铁律核心数据一句话
1结构化 > 裸铁律100% vs 96.1%,1.44× vs 2.28×要求/禁止成对写
2纪律进身份,信息进记忆触发 3/3 vs 1-2/3记忆是参考,身份是要求
3记忆粗粒度起步0.80× vs 1.24×5 条一句话起步
4触发词精准窄误加载 3/3 vs 0/3技能名当门面
5体积分界 25/50KB1.29× vs 省 13.5%小不拆,大拆
6甜点区 + 形态分档1.4-1.7× vs 2.66×别全家桶
7考卷 + 六维 + 取证事实用例补漏可复现地能用

这套方法的边界(诚实版)

这套铁律来自 200 多次会话,但有几件事我们还没测:

  • 长对话退化:8 轮内无退化是实测,20-50 轮的边界未知(交付中观察中)
  • 模型差异:全部实验基于 deepseek-v4-flash;换模型后成本绝对值变,相对比率可参考
  • 框架差异:实验载体是 Hermes Agent(开源);其他框架的约束注入/记忆机制不同,阈值要实测
  • 任务类型:考卷是 4 个约束敏感型任务;纯创作类/纯检索类任务的配置结论可能不同

欢迎用你手上的 Agent 框架复现这套方法——方法比结论更通用:立考卷、定基线、跑对照、取六维。如果复现结果和我们不一样,欢迎来评论区对账,那正是这个系列存在的意义。

系列完结

从「AGENTS.md 怎么写」到「怎么验收」,七篇文章、200 多次实验——我们把「AI Agent 配置」从经验之谈变成了可测量的数据。

本系列的核心资产(全部可直接复制):

  • AGENTS.md 结构化模板(第一篇)
  • 粗粒度记忆模板(第二篇)
  • 技能描述范式 + 体积判据(第三篇)
  • 交付包分档配置(第四篇)
  • 多轮交付三件事(第五篇)
  • 验收报告模板(第六篇)

后续我们会在真实交付中继续验证和补充这些结论(尤其是长对话退化边界),有新数据会在评论区/后续文章同步。

📚 更多实战记录见我的博客:鱼日先生


💬 你复现了哪条铁律?结果一致还是翻车了?评论区对账,我们持续更新。

本系列完——欢迎回看 ,获取完整阅读信息。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐