Hermes Agent 深度评测:自学习 AI Agent,MoA 混合智能体与越用越好用的记忆系统
发布 2026-08-30更新 2026-08-30核实 2026-08-30一句话结论
如果你想要的不是一个「帮你干完一次任务」的云端 Agent,而是一个你能完全掌控、会积累经验、常驻在你消息软件里的自进化 Agent——Hermes Agent 是 2026 年最成熟的开源选择:Nous Research 出品,2026 年 2 月开源即爆,5 月 GitHub Star 翻倍到 10 万量级。
但先泼冷水:它的门槛比 Manus 高一个数量级。没有开箱即用的漂亮界面,要自己装 Python 环境、配 LLM API、管记忆数据库。它面向「想拥有自己 Agent 基础设施」的极客,不面向「想要一个好用助手」的用户。
推荐路径:先在一台 4 核 16GB 的 VPS 上跑 Telegram 渠道 + Claude API 后端(月成本 $10-20),跑满两周确认记忆积累符合预期,再考虑接入更多渠道和 MoA。不要一上来就自托管 Hermes 4 70B——本地跑它需要约 48GB 显存。
Hermes Agent 真正在解决的问题
社区聊 Hermes 为什么火,都说「10 万 Star」「Nous Research 出品」。但拆开看,它解决的是通用 Agent 的三个结构性痛点——而这三个痛点恰好是商业 Agent 刻意回避的。
痛点一:Agent 没有长期记忆
大多数 Agent 的记忆只有当前会话:昨天教它的偏好、纠正过的错误,今天全部归零。Hermes 内置四层记忆系统(工程细节见下文实测部分),把「越用越好用」从营销话术变成了架构事实。这也是它和 OpenHuman 的 Memory Tree 各走一条路的地方:OpenHuman 用记忆树做「个人数字分身」,Hermes 用四层记忆做「会成长的执行体」。
痛点二:单个模型能力有天花板
这是 Hermes 最有意思的一手棋。2026 年 6 月 Nous Research 加了 MoA(Mixture of Agents):不赌任何单一模型,让多个 Agent 实例并行处理同一个任务,每个可以用不同模型,再由聚合 Agent 合并去重、交叉验证。实测效果:3 个中档模型做 MoA,输出质量接近 1 个顶级模型,成本只有 1/3。
痛点三:Agent 只能在一个地方用
Manus 是 Web-only,OpenClaw 是桌面 + CLI。Hermes 支持 14 个消息渠道——Telegram(最稳)、Discord、Slack、WhatsApp、Signal、Email、CLI、基础版 Web UI,甚至有非官方的微信通道。一个 Agent 实例,多入口常驻:在 Telegram 发消息派活,结果推到 Discord;让它监听 Git 提交自动跑测试。
技术拆解:MoA 到底是什么
先纠正一个高频混淆:MoA ≠ MoE。
| MoE(混合专家) | MoA(混合智能体) | |
|---|---|---|
| 层级 | 模型内部架构 | 应用层编排 |
| 混合对象 | 参数(专家网络) | 完整的 Agent 实例 |
| 谁做路由 | 模型内置 router | Hermes 的聚合 Agent |
| 解决什么 | 单次推理的成本与容量 | 单一模型的能力天花板 |
MoE 是把一个大模型拆成多个专家网络省推理成本;MoA 是把多个完整 Agent(可以各自用不同模型)的输出交叉验证取精华。前者是模型厂商的武器,后者是应用层的武器——两者可以叠加:MoA 里的某个 Agent 完全可以跑一个 MoE 模型。
工程上 MoA 的价值在于用编排换能力:与其每月花大钱买顶级模型的 API,不如三个中档模型互相校验——顺带获得单一模型没有的冗余容错(一个模型幻觉,另外两个能把它纠出来)。代价是延迟和 token 翻倍,适合「要质量不怕慢」的任务,不适合即问即答。
记忆系统实测:四层怎么协作
Hermes 的记忆基于向量数据库(默认 ChromaDB,可换 Qdrant/Weaviate),四层各司其职:
| 层 | 存什么 | 类比人类 |
|---|---|---|
| 工作记忆 | 当前会话上下文 | 短期记忆 |
| 情景记忆 | 每次交互的时间、事件、结果,可按时间线回溯 | 「那天发生了什么」 |
| 语义记忆 | 从交互中抽取的偏好、事实、规则,长期保存 | 「我知道的事」 |
| 技能记忆 | Agent 自动总结的「怎么做某类事」的步骤 | 肌肉记忆 |
关键机制有三个:
- 自动提取:对话中的关键信息会被自动存进语义记忆,不需要手动「记住这个」
- TTL 过期:记忆有生存时间,避免无限膨胀——这对长期运行的 Agent 是刚需(记忆治理的通病见 Agent 记忆)
- 可迁移:记忆支持 JSON 导出/导入,换机器不用从零养一个新 Agent
实测体感:前两周记忆积累最明显(它会记住你的项目上下文、纠正过的错误),一个月后「技能记忆」开始生效——同类任务直接调用历史步骤,不再从零规划。这正是 Agent 记忆一文说的「事件流 → 提炼 → 沉淀」闭环在产品层的落地。
Profile 自进化:越用越好 的闭环
Hermes 最独特的设计是 Profile 系统:每个 Profile = 人格 + 技能包。你可以建「代码助手」「研究助手」「项目经理」多个 Profile 并行跑,每个有独立的记忆和技能库。
自进化的机制:任务完成后 Agent 自动总结经验,更新 Profile 的技能库;下次遇到类似任务直接调用。对比市面上大多数 Agent 的「每次从零开始」,这是把 AGENTS.md 式的项目记忆自动化了一层——不用你手写规则,它自己长规则。
代价同样要讲清楚:自动总结的经验不一定对,错误经验会被反复调用越滚越扎实(记忆污染问题)。所以重要 Profile 的技能库要定期人工 review,把跑偏的条目删掉。
部署实践与成本账本
最小可用部署
git clone https://github.com/NousResearch/hermes-agent
cd hermes-agent
pip install -r requirements.txt
cp .env.example .env
# 配置 LLM API key + 消息平台 token
python -m hermes.agent
要求:Python 3.11+、至少 8GB RAM、向量数据库默认 ChromaDB(零额外部署)。日常使用最顺的组合是 Telegram + Claude API:发消息派任务,执行中实时推进度,完成后自动更新记忆。复杂任务 2-5 分钟,不是即问即答。
成本账本
| 项目 | 成本 |
|---|---|
| Hermes 本体 | 免费(开源 MIT) |
| VPS | $5/月起步(4 核 16GB 推荐) |
| LLM API | BYOK 按量,日常任务 $5-15/月 |
| 本地模型(可选) | 70B 需 ~48GB VRAM,405B 需 ~240GB(多卡服务器) |
| 合计(API 路线) | 约 $10-20/月 |
省钱路径:BYOK 接国产模型(国产编程模型盘点)能把 API 成本再压一个量级——Qwen3.8-Flash 推理 ¥1/¥3 每百万 token 的价格,跑日常任务几乎无感。但注意 Hermes 文档以英文为主,接国产模型要自己处理兼容配置,BYOK 上手是通用方法。
短板与坑
- 中文体验 2/5:文档、社区、界面全英文。Hermes 4 模型本身中文能力也弱于 Claude/GPT,中文场景务必用 Claude/GPT 做后端
- 迭代快 = 不稳定:每周多个 commit,偶尔 breaking change。升级前备份记忆数据库(JSON 导出),别裸奔
- 资源消耗是乘法:MoA 开 3 个 Agent,token 消耗 ×3;记忆系统长期驻留内存。成本估算别按单 Agent 算
- UI 简陋:Web UI 只是基础版,管理主要靠 CLI 和 JSON 配置
与同类对比
| 维度 | Hermes Agent | Manus | OpenClaw | OpenHuman |
|---|---|---|---|---|
| 形态 | 自托管多渠道 | 云端 Web | 桌面常驻 | 桌面个人分身 |
| 开源 | MIT | GPL-3.0 | ||
| 自进化 | Profile 系统 | 有限 | Memory Tree | |
| 多渠道 | 14 渠道 | Web only | 桌面+CLI | 桌面 |
| 上手难度 | ||||
| 适合人群 | 极客/研究者 | 普通用户 | 开发者 | 知识工作者 |
一句话分工:Manus 是「用」,OpenHuman 是「陪」,Hermes 是「拥有」。想要详细的两两对比,看 Hermes vs Manus、Hermes vs OpenClaw、Hermes vs OpenManus。
适合 / 不适合
适合:
- 想要自托管、数据完全自主的长期 Agent
- 对自进化/记忆系统有研究或折腾兴趣
- 需要 Telegram/Discord/Slack 多渠道常驻
- 有一台 VPS、会基本的 Python 部署
不适合:
- 中文为主交互的用户(见短板)
- 想要开箱即用、零运维的个人用户
- 需要生产级 SLA 的团队(项目仍在快速迭代)
FAQ
Q:MoA 什么时候开? 要质量不怕慢的任务开(深度调研、重要报告的交叉验证),即问即答关掉——token 消耗是 Agent 数的倍数。
Q:记忆数据存在哪,安全吗? 默认本地 ChromaDB(SQLite + 向量索引),数据不出你的机器;可换 Qdrant/Weaviate 远程库。但要注意:记忆里存的是你和它的全部交互,VPS 本身的安全(SSH 加固、磁盘加密)要自己负责。
Q:能跑在 Windows 上吗? 官方支持 Linux/macOS/Windows,但生产实践以 Linux VPS 为主。Windows 本地跑建议走 WSL2。
Q:和 OpenManus 怎么选?OpenManus 是 Manus 的开源复刻,定位「通用任务执行器」,轻、上手快;Hermes 重、功能全、可自进化。要「复刻云端 Agent 的体验」选 OpenManus,要「长期养一个自己的 Agent」选 Hermes——详见 开源通用 Agent 上手。
相关阅读
- Hermes Agent 工具卡
- OpenHuman 深度评测 · Manus 深度评测
- 开源通用 Agent 上手 Playbook
- Agent 记忆:记忆系统的工程实践
- MoE:MoA 的模型层「亲戚」
- BYOK:接国产模型压成本
来源
不适合想要开箱即用、稳定省心的普通用户,以及没有服务器运维经验、只想要中文交互的个人玩家
- 文档和社区几乎全英文,中文交互体验 2/5,国内用户上手门槛显著高于 Manus
- 项目迭代极快(每周多个 commit),偶尔有 breaking change,生产环境跟进要小心
- 记忆系统 + MoA 多 Agent 并行会吃掉大量内存和 API token,成本是「基础账单 × Agent 数」
- Web UI 只是基础版,日常管理主要靠 CLI 和配置文件,体验精致度远不如商业产品
AutoGLM vs Manus:国产通用 Agent 怎么选
AutoGLM vs Manus 2026 选型对比:智谱开源 GUI Agent 与蝴蝶效应通用 Research Agent 的定位、Agent 能力、中文可用性、私有部署、价格和适合人群全方位对比。一个操作手机浏览器界面、一个云端产出深度报告,帮你判断该用哪个国产 Agent,以及能不能两个都用。
Devin vs Manus:AI Agent 怎么选?2026 对比
Devin vs Manus 2026 选型对比:Cognition 出品的自主 AI 软件工程师 vs Butterfly Effect 的通用 AI Agent。从定位、核心能力、自主程度、价格、国内可用性和适用场景 6 个维度帮你选对 AI Agent。
Dify vs Manus:Agent 平台 vs 通用 Agent 怎么选?2026 对比
Dify vs Manus 2026 选型对比:开源 LLMOps Agent 平台 vs Butterfly Effect 通用 AI Agent。从定位、核心能力、可定制性、开源、价格和适用场景 6 个维度帮你选对 Agent 工具。
Genspark vs Manus:通用 AI Agent 怎么选?2026 对比
Genspark vs Manus 2026 选型对比:Palo Alto 出品的多 Agent 全栈 Super Agent vs Butterfly Effect 的通用 Deep Research Agent。从定位、核心能力、模型支持、价格、国内可用性、适用场景 6 个维度帮你选对通用 AI Agent。
Hermes Agent vs Manus:开源自进化 Agent 对决通用 Agent 天花板,2026 怎么选?
Hermes Agent vs Manus 2026 选型对比:Nous Research 开源自进化 Agent(MoA+记忆系统+14 渠道部署)vs Butterfly Effect 通用 Agent 天花板(多 sub-agent 并行+多模型路由+小时级长任务)。从定位、核心能力、自主程度、价格、国内可用性、适用场景 6 个维度帮你选对 Agent。
Hermes Agent vs OpenClaw:Agent 框架 vs IM 网关(2026 实测选型)
Hermes Agent 和 OpenClaw 都是开源 AI Agent,但一个强调自进化 + 记忆 + 跨平台部署,一个强调 IM 网关 + 7×24 Heartbeat + Skills 市场。本文从定位、能力、价格、国内可用性帮你选对工具。