Hermes Agent 调教实录(四):AI Agent 交付包怎么配不翻车?——约束叠加的边界实测

Hermes Agent 调教实录 · 4/8 | 实验批次:HERMES-104/105
基于 Hermes Agent v0.20.0 实测(2026-08,deepseek-v4-flash)

📖 摘要:配置不是越多越好。四层约束全家桶成本 2.66×、纪律稀释;单层结构化 1.44× 达标率就到 100%。交付包按形态分档:多轮对话配纪律层+记忆,单轮自动化配全套——别全家桶。

场景:配置越加越多,Agent 反而越来越不听话

前两篇讲的是「怎么配置有效」。但交付做到第三个月,我们遇到了一个新问题:配置加多了,Agent 变笨了

给客户交付 Agent 时,我们的本能是「把好东西全配上」:项目约束文件(AGENTS.md)、身份文件(SOUL)、用户画像(USER)、记忆(MEMORY)、行业技能包——全给它装上。结果呢?

  • 每个任务启动时,Agent 要先读一整套配置,上下文肉眼可见地膨胀
  • 原本「先查技能再动手」的纪律,反而执行得不稳定了——有时候查,有时候不查
  • 客户问「为什么这个 Agent 反应这么慢」,我们只能苦笑

约束文件不是越多越好吗?我们把所有层都配齐了,怎么会翻车?

实验设计:全家桶 vs 裸 Agent

为了验证「约束叠加」的边界,我们做了 HERMES-104 实验:组装验证。

变体配置说明
A 裸 Agent无约束、无记忆、无技能对照组
B 交付包全家桶AGENTS.md + SOUL + USER + MEMORY + 清洗技能「好东西全配上」的典型配置

考卷还是那 4 个任务(格式转换/技能纪律/报告写作/代码自测),2 变体 × 4 任务 × 3 轮 = 24 次会话。

实测结果:全家桶的成本曲线,触目惊心

指标A 裸 AgentB 交付包全家桶
一次成功率75%83.3%
任务达标率94.1%96.1%
成本98.6k(1.00×)262.2k(2.66×)
技能纪律(T2 查技能)0/31-2/3

达标率只涨了 2 个点,成本涨了 166%。更值得注意的是:全家桶的技能纪律反而稀释了——12 次会话里只有 2-3 次技能加载,比单层结构化配置的 3/3 差。

把四个批次的数据放在一起,约束的成本曲线一目了然:

配置成本达标率
无约束1.00×88-94%
单层结构化(AGENTS.md)1.44×100%
三层组合(SOUL+USER+MEMORY)1.66×100%
四层全家桶2.66×96.1%

规律:成本随约束层数线性上升,达标率在单层结构化就到顶(100%),再叠加收益递减、纪律稀释。 约束存在「甜点区」——一到两层结构化配置是最优解,全家桶是过载。

为什么过载?复盘结论:约束文件的本质是「上下文里的指令」。指令越多,Agent 的注意力越分散;而且不同层的约束可能互相冲突(比如 SOUL 要求「汇报详细」,考卷要求「字数 200 字内」),Agent 无所适从时,选择「都不好好执行」。

更细的边界:按交付形态分档

104 之后我们又跑了 105(多轮对话实验,详见第五篇),发现交付包的配法还取决于交付形态

交付形态配置方案依据
多轮对话(IM 接入/对话交付)纪律层 + 记忆即可输出形态要求靠对话自然形成,约束补纪律,成本 1.40×
单轮自动化(批量任务)全套(纪律 + 输出格式)没有对话可依赖,约束要全覆盖

多轮形态下,「用户在第 2 轮说的要求」会被 Agent 记住并跨轮执行(对话即约束)——输出格式这类要求不用写进配置;但「先查技能」「写完自测」这类行为纪律,对话不会自然形成,必须靠约束文件。

所以交付包的配法不是「越多越好」,也不是「固定一套」,而是按形态选配

增强层

核心层(二选一,不叠加)

项目级 AGENTS.md 结构化(单轮自动化形态)

全局级 SOUL/USER + MEMORY(多轮对话形态)

技能层(1-2 个任务相关技能,精准触发词)

验收层(考卷 + 六维,交付前必跑)

交付包 = 核心层(二选一,不要叠)
  ├─ 项目级:AGENTS.md 结构化(单轮自动化形态)
  └─ 全局级:SOUL/USER + MEMORY 环境事实(多轮对话形态)
+ 技能层(1-2 个任务相关技能,精准触发词)
+ 验收层(考卷 + 六维,交付前必跑)

实战坑

现象修复
全家桶叠加成本 2.66 倍,纪律稀释核心层二选一,不叠加
约束互相冲突汇报详细 vs 字数限制,Agent 都不执行同一约束只在一层定义(唯一权威原则)
多轮形态配全套输出格式约束多余,成本白涨按形态分档:多轮配纪律层
单轮形态只配纪律层输出格式没约束,全靠 prompt单轮配全套

适用边界

  • 「甜点区」结论基于 4 个约束敏感型任务的考卷;任务越简单,约束冗余的影响越小
  • 成本数据基于 deepseek-v4-flash(2026-08 价格);换模型后绝对值会变,相对比率(1.4-1.7× vs 2.66×)可参考

一句话总结

约束的甜点区 = 一到两层结构化;交付包的配法 = 按形态选配,不全家桶。 把「好东西全配上」的冲动收一收,Agent 反而更听话。


📚 更多实战记录见我的博客:鱼日先生

💬 你有没有「配置越加越乱」的经历?评论区聊聊你最后删掉了哪些配置。

下一篇:Hermes Agent 调教实录(五):和 AI Agent 多轮对话怎么不跑偏?

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐