Harness Engineering vs Hermes Agent:AI 工程化,到底该信"人治"还是"自治"?

一场关于 AI 辅助开发方法论的激烈辩论

正方:Harness Engineering —— “AI 需要被管教,规则必须掌握在人手里”

反方:Hermes Agent —— “AI 应该自己学会成长,人类不该是规则的奴隶”


在这里插入图片描述

开场白:两路人,一条路

2025 年,Terraform 创始人 Mitchell Hashimoto 扔出一篇长文,系统阐述了 Harness Engineering —— 一套让 AI Coding Agent 真正可用的方法论。

核心理念很简单,却很残酷:

“AI 是个聪明但健忘的初级工程师,你得持续教它、管它、审它。”

几个月后,Nous Research 推出了 Hermes Agent,把这套理念直接产品化,还加了一句更狠的 slogan:

“The Agent That Grows With You(会自己长大的 Agent)”

于是,一场关于"AI 工程化到底该走哪条路"的争论,正式打响。


第一轮交锋:效率,还是可控?

正方(Harness):“你不盯着,它就一定给你埋坑”

Harness 的支持者会说:

“你敢让 AI 自己改规则吗?一次手滑,生产事故你负责还是 AI 负责?”

Harness Engineering 的核心,是人掌握最终决策权

  • CLAUDE.md 里的每一条规则,都是人写的
  • 每一次 AI 犯错,都是人来判断该加什么约束
  • CI/CD 流水线、linter、hooks,层层把关

优点很明确:可控、可审计、可解释。大企业合规团队看了直点头。

但缺点同样致命:你得持续投入。Mitchell 自己都说,他花了几个月才把这套体系搭建起来。普通团队,有人力这么玩吗?


反方(Hermes):“人类维护规则,本身就是个笑话”

Hermes 的支持者反手就是一句:

“你们 Harness 用户,本质上是在给 AI 当全职保姆。这叫工程化?这叫人力外包给 AI 了?”

Hermes 的核心主张是:规则维护本身,就应该交给 AI

它内置了一个"自改进循环":

完成任务 → 自动总结成功经验
       → 识别重复模式,生成/优化 Skill
       → 下次执行时自动加载
       → 人偶尔审查,不满意就覆盖

优点很诱人:装好之后,AI 越用越懂你,你不用天天改配置文件。

但问题也来了:AI 自己生成的规则,你真的敢无条件信任?万一它"学歪了"呢?


第一轮裁决:短期 Harness 稳,长期 Hermes 狠

  • 如果你做的是金融、医疗、核心基础设施 —— 选 Harness,合规审计需要人来背书
  • 如果你做的是个人项目、创业 MVP、内部工具 —— Hermes 的自主进化能帮你省大量时间

第二轮交锋:门槛,谁能真正用得上?

正方(Harness):“懂的人自然懂,不懂的就别来凑热闹”

Harness 方法论的现实是:

  • 你要懂 CLAUDE.md 怎么写
  • 你要懂 hooks 怎么配置
  • 你要懂怎么设计约束层、反馈层、记忆层
  • 你还要持续投入时间维护

Mitchell 自己就是顶级工程师,他玩得转,不代表普通开发者玩得转。

支持者会说:“AI 工程化本来就是给专业团队用的,降低门槛等于降低质量。”


反方(Hermes):“技术门槛,从来都是用来被消灭的”

Hermes 的立场很明确:

“如果你需要读 Mitchell 的博客才能用好 AI Agent,那这个行业就有问题。”

Hermes 的安装体验:

# 一行命令,装好就能跑
pip install hermes-agent

然后改一份 YAML 配置文件,填好你的 API Key,done

不需要理解什么是"三层记忆架构",不需要知道怎么配置 hooks,因为这些都内置了

支持者说:“Harness 是给工程师用的工具,Hermes 是给所有人用的产品。”


第二轮裁决:Hermes 赢了易用性,但代价是"黑盒化"

Hermes 把复杂度藏起来了,藏得好看,但也藏得你看不懂

当出问题的时候,Harness 用户至少知道去查哪条规则;Hermes 用户可能只能对着日志发呆。


第三轮交锋:记忆,AI 到底该不该"记得"?

正方(Harness):“记忆是人精心整理的,不是 AI 瞎编的”

Harness 的记忆层,本质是一个精心维护的知识库

  • 项目背景、架构决策、踩过的坑 → 人写进 CLAUDE.md
  • 编码规范、工具链配置 → 人写进对应配置文件
  • 历史对话中的重要结论 → 人决定要不要记

核心理念:记忆是人的知识,AI 只是读取和执行。

支持者认为这很对:

“AI 没有判断力,它不该决定什么值得记住。”


反方(Hermes):“人类维护记忆,必然遗漏,必然过时”

Hermes 的三层记忆架构:

记忆层级 存储内容 检索方式
会话记忆(情景记忆) 历史对话片段 SQLite + FTS5 全文索引
持久记忆(语义记忆) 用户偏好、项目习惯 按需加载,不堆上下文
Skill 记忆(程序性记忆) 标准化操作 SOP Markdown 文件,~/.hermes/skills/

关键区别:这些记忆,主要是 AI 自己沉淀的,不是人手工写的。

Hermes 支持者说:

“人类会遗忘,人类会偷懒,人类维护的记忆库一定会腐烂。AI 自己维护的记忆,反而更实时、更全面。”


第三轮裁决:双方都有道理,但场景不同

  • Harness 的记忆 → 适合团队协作,因为人写的东西人可以审查和共识
  • Hermes 的记忆 → 适合个人助手,因为你自己的习惯,AI 比你更清楚也不奇怪

第四轮交锋:多 Agent 编排,谁来管?

正方(Harness):“多 Agent 系统,必须有人设计全局架构”

Harness 方法论里,多 Agent 协作是人设计的

  • 哪个 Agent 负责哪个模块 → 人定
  • Agent 之间的接口和协议 → 人定
  • 出错时谁负责 → 人定

支持者观点

“你敢让 AI 自己决定怎么拆分任务、怎么分配 Agent 吗?这不是自治,这是失控。”


反方(Hermes):“内置编排,就是为了让普通人也能用多 Agent”

Hermes 内置了:

  • 子 Agent 委派:主 Agent 可以自动 spawn 子 Agent 并行执行
  • cron 调度:定时任务,无人值守
  • 最多 3 个子 Agent 并发(这个限制是故意的,防止失控)

Hermes 支持者说:

“Harness 的多 Agent 是给架构师用的,Hermes 的多 Agent 是给普通开发者用的。你不需要懂编排理论,就能让 AI 团队帮你干活。”


第四轮裁决:Harness 胜在可控,Hermes 胜在易用

这轮没有绝对赢家,取决于你的团队规模和专业度。


终极对决:哲学层面,AI 到底该不该"自治"?

这才是真正的根本分歧。

正方(Harness)的哲学:

“AI 是锤子,人是拿锤子的人。锤子不能自己决定敲哪里。”

背后是对 AI 能力的不信任,或者说理性谨慎

  • AI 没有真正的理解能力
  • AI 的"学习"本质是统计模式匹配
  • 让 AI 自主决策,风险不可控

这是工程思维:可预测、可验证、可回滚,比"酷"更重要。


反方(Hermes)的哲学:

“AI 如果不够自治,它就永远只是个高级搜索引擎,而不是 Agent。”

背后是对 AI 能力的乐观信念

  • LLM 的推理能力在快速进步
  • 自主进化的 Agent,长期来看必然超越人工规则
  • 人类维护规则的范式,本身就是瓶颈

这是产品思维:好用、自动、省心,比"可控"更能打动用户。


终极裁决:这是两条会长期并存的路线

维度 Harness Engineering Hermes Agent
适合人群 资深工程师、企业团队 个人开发者、产品团队
核心理念 人主导,AI 执行 AI 自治,人监督
维护成本 高(持续人力投入) 低(偶尔审查)
可控性 中(黑盒程度较高)
学习曲线
适合场景 合规严格的企业环境 快速迭代的个人/创业项目

结论:别吵了,看场景选

这场辩论,没有绝对的赢家。

选 Harness Engineering,如果你:

  • 在严格合规的行业(金融、医疗、基础设施)
  • 团队有资深工程师,愿意投入时间搭建体系
  • 需要完全可审计、可解释的 AI 辅助流程
  • 不信任"黑盒自治",要的就是可控

选 Hermes Agent,如果你:

  • 想要一个能记住你习惯、越用越懂你的 AI 助手
  • 没有精力搭建复杂的 AI 工程体系
  • 做的是快速迭代的项目,容错空间相对大
  • 想要 7×24 运行的无人值守任务(定时报告、监控、自动化脚本)

彩蛋:未来会怎样?

最有意思的问题是:Hermes 会不会反过来"吃掉" Harness?

想象一下:

一个团队,用 Harness 方法论搭建了完善的 AI 工程体系;然后,他们用 Hermes 的自主进化能力,把自己的 Harness 规则库自动化维护起来

人定义"什么是对的",AI 负责"持续逼近那个标准"。

这或许才是 AI 工程化的终极形态:人设定价值观和方向,AI 负责执行和持续优化。

Harness 和 Hermes,也许不是对手,而是同一枚硬币的两面


写于 2026 年 5 月,AI 工程化大爆发的年代。

欢迎在评论区告诉我:你是"人治派"还是"自治派"?

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐