Hermes Agent 是 Nous Research 主导的开源 AI Agent 框架,v0.20.0(The Herald Release)于 2026 年 8 月 3 日发布,单版本合并约 1,400 个 PR、3,650 次提交、650+ 贡献者参与,是项目有史以来规模最大的一次迭代;核心升级集中在三条主线:语音交互实现流式输出与打断(barge-in)、A2A v1.0 协议让多个 Hermes 实例可互相发现和通信、以及一轮系统性开发者体验补全(12 个新 CLI 命令、工具调用迭代上限从 90 升至 500、运行中纠偏);同期 2026 年版本节奏已稳定在每两周一个命名版本,从 5 月的 PyPI 一键安装、6 月的桌面应用正式版、7 月的首 Token 延迟降低 80%,到本次语音与多智能体协议的全面落地,完整展示了这个项目从"CLI 工具"向"跨平台 AI Agent 基础设施"的演进路径。


Hermes Agent 由 Nous Research 开源,v0.20.0 于 2026 年 8 月 3 日发布,单版本合并了约 1,400 个 PR、3,650 次提交、5,200 个文件变更,650 多名贡献者参与,是 Hermes 迄今规模最大的一次迭代。这次升级同时推进了三条主线:语音交互从"能用"到"自然"(流式输出 + 打断 + 唤醒词),Agent 架构从单体扩展到多智能体互联(A2A v1.0),以及一轮系统性的开发者体验补全(12 个新 CLI 命令 + 工具自愈 + 运行中纠偏)。本文逐条拆解最值得关注的变化,并梳理 2026 年上半年的版本演进脉络,帮助已经在用或正在考虑接入 Hermes 的开发者评估升级收益。


语音从"能用"到"自然"

Hermes 的语音能力在这个版本里完成了最关键的一跳——实时流式输出加上打断(barge-in)。

此前大多数语音 AI 的交互模式是:说完一整句,等模型处理完,再听回复。v0.20.0 改成了逐子句实时播放,用户随时可以打断——开口说话,AI 立即停止,切换到倾听状态。忙碌感知静音检测则保证用户在思考时 AI 不会误触发。

另一个细节是唤醒词。新版支持开放词汇自定义唤醒短语,比如"hey Hermes",检测完全在本地完成,无音频外传。加上"stop"命令可以跨所有界面终止语音会话,从体验上看已经非常接近系统级语音助手的使用习惯。

多平台语音支持也在这版铺开:WhatsApp、LINE、QQ、飞书等平台现在支持语音消息转录与回复,STT 统一可配置。这意味着 Hermes 在这些渠道上不再是纯文字 bot,而是可以接收和发送语音的 AI Agent。


A2A v1.0:四年最早期功能请求的终结

v0.20.0 实现了 Agent-to-Agent(A2A)协议 v1.0,关闭了 Hermes 项目最早的功能请求之一——GitHub issue #514。

A2A 让 Hermes 可以发现其他兼容代理并与之通信。实际含义是:你可以把多个 Hermes 实例(或其他支持 A2A 协议的 Agent)组成协作网络,一个负责搜索、一个负责代码执行、一个负责用户界面,主 Agent 负责调度和汇总。

这个能力在 v2026.7.1 Judgment 版本里就埋下了伏笔——那一版引入了 Mixture-of-Agents 预设和支持后台并行的 Projects,A2A v1.0 是这个方向的正式落地。

需要注意的是 A2A 目前是 v1.0,生态还在早期。要真正发挥多智能体协同的效果,各个节点的工具调用能力和上下文共享机制需要额外的工程设计——这不是开箱即用的"几个 Agent 自动协作",而是提供了一套协议和 SDK,开发者来决定怎么组网。


开发者体验:12 个新命令 + 工具自愈

这一版对 CLI 做了一轮集中补全,列一下最常用的几个:

命令 作用
!command 直接执行 Shell 命令,不消耗模型轮次
/init 扫描项目结构,自动生成或更新 AGENTS.md
/diff 显示暂存/全部/当前会话的变更
/context 分析当前上下文窗口占用情况
/focus 精简输出视图,减少干扰信息
Ctrl+S 保存半写提示到可浏览面板,下次继续
hermes import-agent 从 Claude Code 或 Codex CLI 迁移配置

hermes import-agent 值得单独说一下。它直接读取 Claude Code 或 Codex CLI 的配置并迁移过来,降低了从其他 Agent 工具切换的成本,对于已经在 Claude Code 上积累了大量 AGENTS.md 或 Skills 配置的团队来说是个实用入口。

运行中纠偏(Redirects) 是另一个高频场景的改善。以前如果 AI 在执行过程中走偏了,要么等它跑完再重新提问,要么强制中断重来。现在可以在任意节点输入纠正,当前轮次被重定向而非重启,原始提示保留,支持双 ESC 丢弃草稿和撤销栈。

工具自愈则解决了长链任务中工具调用失败导致整体中断的问题:截断的终端输出会溢出到文件供 Agent 读回,patch 能检测已应用的编辑并诊断空白不匹配,write_file 会验证磁盘内容,搜索无结果时自动探测近似匹配。更关键的是,默认工具调用迭代上限从 90 提升到了 500——这对于需要多步骤工具调用的复杂 Agent 任务意义很直接。


在这里插入图片描述

2026 年的版本节奏:每两周一次主要更新

把 2026 年的版本历史铺开来看,有一个明显的节奏:

  • v2026.7.20 Quicksilver:首轮首 Token 延迟降低约 80%,Bitwarden/1Password 密钥源接入
  • v2026.7.1 Judgment:Mixture-of-Agents、/goal 目标系统、Projects 后台并行、Gateway scale-to-zero
  • v2026.6.19 Reach:iMessage 接入 Raft agent network、Automation Blueprints
  • v2026.6.5 Surface:macOS/Linux/Windows 桌面应用正式版,完整简体中文界面
  • v2026.5.28 Velocity:核心架构重构(run_agent.py 从 1.6 万行拆分为模块),promptware 防护
  • v2026.5.16 Foundation:PyPI 一键安装(pip install hermes-agent),Windows 支持,供应链加固

这个节奏大概每两周出一个命名版本,主要功能版本之间还穿插补丁。对于生产环境的团队来说,追最新版不现实,建议关注命名版本(有版本代号的那些)并在每个大版本发布后评估一次升级窗口,补丁版本跟进即可。


接入层的选择

Hermes 支持的 Provider 已经相当广:Anthropic 原生、Google AI Studio、AWS Bedrock、Nous Portal(400+ 模型)、xAI Grok、Hugging Face 等,v0.20.0 还保留了对 OpenAI 兼容本地代理的支持。

国内开发者接入时有一个常见痛点:多个模型服务各自的 API Key 管理、密钥安全,以及 Hermes 的 MCP 工具调用和外部服务对接。七牛云 MCP 服务支持 SSE、HTTP-Streamable 等多种协议接入,密钥在云端托管,可以作为 Hermes 工具调用层的统一接入点,避免在本地暴露各服务凭证。对于需要把 Hermes 连接多个国内模型(DeepSeek、Kimi、GLM 等)的场景,通过七牛云 AI 的单一 API Key 统一接入,兼容 OpenAI 格式,与 Hermes 的 Provider 配置逻辑吻合。


可信引用:一个被低估的新能力

grounded-citations 技能在这版正式发布,每个声明都带可验证来源,引文与实际页面文本匹配,内含事实核查模式。

这个能力的适用场景比表面看起来更广:任何需要 Hermes 代为研究、整理报告、或做决策支撑的场景,都能用可信引用来保证输出内容有溯源依据,而不是纯粹的模型生成。对于已经在跑自动化工作流(Automation Blueprints)的团队,配合出站 Webhook 可以把"有引用的研究报告"推送到任意下游系统,整个流程无需人工介入。


升级前的几个实际问题

从哪个版本升? v0.19.x 用户可以直接升,v0.19.1 的所有补丁内容已合并进 v0.20.0。pip 安装用户运行 pip install --upgrade hermes-agent 即可;Docker 用户更新镜像标签到 v2026.8.3

语音功能默认开启吗? 默认不开启,需要在配置文件里启用语音模式,首次使用需要配置 STT 端点(支持 OpenAI gpt-transcribe 和其他兼容接口)。

A2A 现在能直接用吗? 协议层已就位,但需要对端也实现 A2A 兼容。目前最简单的验证方式是启动两个 Hermes 实例进行本地测试。

工具调用上限从 90 改到 500 会不会超 Token 预算? 会的,上限提升只是去掉了硬性截断,实际消耗取决于任务复杂度。建议配合上下文压缩(已在 v0.20.0 大幅优化)和 Token 预算管理一起使用。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐