Hermes Agent v0.20.0 发布:开源编程 Agent 学会说话、学会协作、学会查证
Nous Research 今天发布 Hermes Agent v0.20.0,代号 "The Herald"(信使之神)。这是这个开源编程 Agent 迄今规模最大的版本更新——合并了约 3650 次提交、1400+ 个 PR、650+ 位贡献者的工作。核心变化可以用三句话概括:Hermes 现在能跟你实时语音对话了,能跟其他 Agent 正式协作了,做研究时每句话都能给出处了。
语音对话:从"语音信箱"变成真正对话
之前的语音模式体验是:你说一句,等整段回复生成完,再听一段长音频。v0.20.0 彻底改了这个流程——Hermes 现在逐句流式输出语音,你说到一半想打断,直接开口就行,它会停下来听你讲。忙碌感知的静默检测确保它不会抢你的话。
这套语音交互在 CLI 语音模式、桌面应用、以及通过 Gateway 适配器连接的各平台都能用。跟编程 Agent 对话终于像跟同事说话,不像给语音信箱留言了。
唤醒词:终端也能隔空指挥
你可以自定义唤醒短语(比如"hey Hermes"),说完它就开始听。唤醒词检测完全在设备端运行,等待状态下音频不会离开你的机器。不同唤醒词还能路由到不同配置文件——比如工作项目用一个唤醒词,个人项目用另一个。说"stop"就能结束语音会话,全程不用碰键盘。
A2A v1.0:Agent 之间正式对话
Agent-to-Agent(A2A)协议迎来首个正式版本 v1.0。Hermes 现在可以把子任务委托给其他 Agent,也能接收来自其他 Agent 的请求。这是多 Agent 协作编程的基础设施——想象一下,一个 Agent 负责写代码,另一个负责跑测试,第三个做安全审查,它们之间通过 A2A 协议自动协调。
桌面端变成平台
Hermes 桌面应用不再只是个聊天窗口:
- Artifacts 实时预览:代码、图表、文档生成后直接在窗口里看效果
- 插件 SDK:第三方可以开发插件扩展功能
- 快速入口:从系统任何位置快速唤起 Hermes
- 多窗口:同时跑多个 Agent 会话,各看各的
CLI 大幅增强
终端用户也收获不少:
!进入 shell 模式,直接执行系统命令/init、/diff、/context、/focus等新快捷命令- 上下文压缩更智能、更温和,不会粗暴截断重要信息
- 工具自恢复:工具调用失败后自动重试,不再把错误丢给模型让它猜怎么办
可验证引用:研究不再是"相信我"
新增 grounded-citations skill,让 Hermes 做研究时每个声明都附带可验证来源。引用会与原文匹配,还有事实核查环节。对于需要查资料、写技术文档的场景,这意味着你不用再逐条去验证 Agent 给你的信息。
安全修复
这个版本也包含了一批安全加固:
- CVE-2026-48710:Starlette 依赖版本锁定
- SSRF 攻击防护加固
- 子进程凭据剥离,防止敏感信息泄露
意味着什么
v0.20.0 把 Hermes 从"终端里的代码助手"推向了"多模态、多 Agent、多平台"的编程 Agent 平台。语音交互让编程 Agent 的使用场景从"坐在电脑前打字"扩展到"在白板前口述需求";A2A 协议让 Agent 协作从概念变成标准;可验证引用让 Agent 输出的可信度上了一个台阶。对于已经在用 Hermes 的开发者,这次更新值得立刻升级。
---
基于 GitHub Releases 页面信息整理。项目地址:https://github.com/NousResearch/hermes-agent