跳到主内容
Hermes AgentAI Agent自学习MoA记忆系统开源深度评测

Hermes Agent 深度评测:自学习 AI Agent,MoA 混合智能体与越用越好用的记忆系统

发布 2026-08-30更新 2026-08-30核实 2026-08-30

一句话结论

如果你想要的不是一个「帮你干完一次任务」的云端 Agent,而是一个你能完全掌控、会积累经验、常驻在你消息软件里的自进化 Agent——Hermes Agent 是 2026 年最成熟的开源选择:Nous Research 出品,2026 年 2 月开源即爆,5 月 GitHub Star 翻倍到 10 万量级。

但先泼冷水:它的门槛比 Manus 高一个数量级。没有开箱即用的漂亮界面,要自己装 Python 环境、配 LLM API、管记忆数据库。它面向「想拥有自己 Agent 基础设施」的极客,不面向「想要一个好用助手」的用户。

推荐路径:先在一台 4 核 16GB 的 VPS 上跑 Telegram 渠道 + Claude API 后端(月成本 $10-20),跑满两周确认记忆积累符合预期,再考虑接入更多渠道和 MoA。不要一上来就自托管 Hermes 4 70B——本地跑它需要约 48GB 显存。

Hermes Agent 真正在解决的问题

社区聊 Hermes 为什么火,都说「10 万 Star」「Nous Research 出品」。但拆开看,它解决的是通用 Agent 的三个结构性痛点——而这三个痛点恰好是商业 Agent 刻意回避的。

痛点一:Agent 没有长期记忆

大多数 Agent 的记忆只有当前会话:昨天教它的偏好、纠正过的错误,今天全部归零。Hermes 内置四层记忆系统(工程细节见下文实测部分),把「越用越好用」从营销话术变成了架构事实。这也是它和 OpenHuman 的 Memory Tree 各走一条路的地方:OpenHuman 用记忆树做「个人数字分身」,Hermes 用四层记忆做「会成长的执行体」。

痛点二:单个模型能力有天花板

这是 Hermes 最有意思的一手棋。2026 年 6 月 Nous Research 加了 MoA(Mixture of Agents):不赌任何单一模型,让多个 Agent 实例并行处理同一个任务,每个可以用不同模型,再由聚合 Agent 合并去重、交叉验证。实测效果:3 个中档模型做 MoA,输出质量接近 1 个顶级模型,成本只有 1/3

痛点三:Agent 只能在一个地方用

Manus 是 Web-only,OpenClaw 是桌面 + CLI。Hermes 支持 14 个消息渠道——Telegram(最稳)、Discord、Slack、WhatsApp、Signal、Email、CLI、基础版 Web UI,甚至有非官方的微信通道。一个 Agent 实例,多入口常驻:在 Telegram 发消息派活,结果推到 Discord;让它监听 Git 提交自动跑测试。

技术拆解:MoA 到底是什么

先纠正一个高频混淆:MoA ≠ MoE

MoE(混合专家)MoA(混合智能体)
层级模型内部架构应用层编排
混合对象参数(专家网络)完整的 Agent 实例
谁做路由模型内置 routerHermes 的聚合 Agent
解决什么单次推理的成本与容量单一模型的能力天花板

MoE 是把一个大模型拆成多个专家网络省推理成本;MoA 是把多个完整 Agent(可以各自用不同模型)的输出交叉验证取精华。前者是模型厂商的武器,后者是应用层的武器——两者可以叠加:MoA 里的某个 Agent 完全可以跑一个 MoE 模型。

工程上 MoA 的价值在于用编排换能力:与其每月花大钱买顶级模型的 API,不如三个中档模型互相校验——顺带获得单一模型没有的冗余容错(一个模型幻觉,另外两个能把它纠出来)。代价是延迟和 token 翻倍,适合「要质量不怕慢」的任务,不适合即问即答。

记忆系统实测:四层怎么协作

Hermes 的记忆基于向量数据库(默认 ChromaDB,可换 Qdrant/Weaviate),四层各司其职:

存什么类比人类
工作记忆当前会话上下文短期记忆
情景记忆每次交互的时间、事件、结果,可按时间线回溯「那天发生了什么」
语义记忆从交互中抽取的偏好、事实、规则,长期保存「我知道的事」
技能记忆Agent 自动总结的「怎么做某类事」的步骤肌肉记忆

关键机制有三个:

  1. 自动提取:对话中的关键信息会被自动存进语义记忆,不需要手动「记住这个」
  2. TTL 过期:记忆有生存时间,避免无限膨胀——这对长期运行的 Agent 是刚需(记忆治理的通病见 Agent 记忆
  3. 可迁移:记忆支持 JSON 导出/导入,换机器不用从零养一个新 Agent

实测体感:前两周记忆积累最明显(它会记住你的项目上下文、纠正过的错误),一个月后「技能记忆」开始生效——同类任务直接调用历史步骤,不再从零规划。这正是 Agent 记忆一文说的「事件流 → 提炼 → 沉淀」闭环在产品层的落地。

Profile 自进化:越用越好 的闭环

Hermes 最独特的设计是 Profile 系统:每个 Profile = 人格 + 技能包。你可以建「代码助手」「研究助手」「项目经理」多个 Profile 并行跑,每个有独立的记忆和技能库。

自进化的机制:任务完成后 Agent 自动总结经验,更新 Profile 的技能库;下次遇到类似任务直接调用。对比市面上大多数 Agent 的「每次从零开始」,这是把 AGENTS.md 式的项目记忆自动化了一层——不用你手写规则,它自己长规则。

代价同样要讲清楚:自动总结的经验不一定对,错误经验会被反复调用越滚越扎实(记忆污染问题)。所以重要 Profile 的技能库要定期人工 review,把跑偏的条目删掉。

部署实践与成本账本

最小可用部署

git clone https://github.com/NousResearch/hermes-agent
cd hermes-agent
pip install -r requirements.txt
cp .env.example .env
# 配置 LLM API key + 消息平台 token
python -m hermes.agent

要求:Python 3.11+、至少 8GB RAM、向量数据库默认 ChromaDB(零额外部署)。日常使用最顺的组合是 Telegram + Claude API:发消息派任务,执行中实时推进度,完成后自动更新记忆。复杂任务 2-5 分钟,不是即问即答。

成本账本

项目成本
Hermes 本体免费(开源 MIT)
VPS$5/月起步(4 核 16GB 推荐)
LLM APIBYOK 按量,日常任务 $5-15/月
本地模型(可选)70B 需 ~48GB VRAM,405B 需 ~240GB(多卡服务器)
合计(API 路线)约 $10-20/月

省钱路径:BYOK 接国产模型(国产编程模型盘点)能把 API 成本再压一个量级——Qwen3.8-Flash 推理 ¥1/¥3 每百万 token 的价格,跑日常任务几乎无感。但注意 Hermes 文档以英文为主,接国产模型要自己处理兼容配置,BYOK 上手是通用方法。

短板与坑

  • 中文体验 2/5:文档、社区、界面全英文。Hermes 4 模型本身中文能力也弱于 Claude/GPT,中文场景务必用 Claude/GPT 做后端
  • 迭代快 = 不稳定:每周多个 commit,偶尔 breaking change。升级前备份记忆数据库(JSON 导出),别裸奔
  • 资源消耗是乘法:MoA 开 3 个 Agent,token 消耗 ×3;记忆系统长期驻留内存。成本估算别按单 Agent 算
  • UI 简陋:Web UI 只是基础版,管理主要靠 CLI 和 JSON 配置

与同类对比

维度Hermes AgentManusOpenClawOpenHuman
形态自托管多渠道云端 Web桌面常驻桌面个人分身
开源MITGPL-3.0
自进化Profile 系统有限Memory Tree
多渠道14 渠道Web only桌面+CLI桌面
上手难度
适合人群极客/研究者普通用户开发者知识工作者

一句话分工:Manus 是「用」,OpenHuman 是「陪」,Hermes 是「拥有」。想要详细的两两对比,看 Hermes vs ManusHermes vs OpenClawHermes vs OpenManus

适合 / 不适合

适合:

  • 想要自托管、数据完全自主的长期 Agent
  • 对自进化/记忆系统有研究或折腾兴趣
  • 需要 Telegram/Discord/Slack 多渠道常驻
  • 有一台 VPS、会基本的 Python 部署

不适合:

  • 中文为主交互的用户(见短板)
  • 想要开箱即用、零运维的个人用户
  • 需要生产级 SLA 的团队(项目仍在快速迭代)

FAQ

Q:MoA 什么时候开? 要质量不怕慢的任务开(深度调研、重要报告的交叉验证),即问即答关掉——token 消耗是 Agent 数的倍数。

Q:记忆数据存在哪,安全吗? 默认本地 ChromaDB(SQLite + 向量索引),数据不出你的机器;可换 Qdrant/Weaviate 远程库。但要注意:记忆里存的是你和它的全部交互,VPS 本身的安全(SSH 加固、磁盘加密)要自己负责。

Q:能跑在 Windows 上吗? 官方支持 Linux/macOS/Windows,但生产实践以 Linux VPS 为主。Windows 本地跑建议走 WSL2。

Q:和 OpenManus 怎么选?OpenManus 是 Manus 的开源复刻,定位「通用任务执行器」,轻、上手快;Hermes 重、功能全、可自进化。要「复刻云端 Agent 的体验」选 OpenManus,要「长期养一个自己的 Agent」选 Hermes——详见 开源通用 Agent 上手

相关阅读

来源

避坑提醒
NOT FOR · 什么情况下不要选它

不适合想要开箱即用、稳定省心的普通用户,以及没有服务器运维经验、只想要中文交互的个人玩家

PITFALLS · 避坑提醒
  • 文档和社区几乎全英文,中文交互体验 2/5,国内用户上手门槛显著高于 Manus
  • 项目迭代极快(每周多个 commit),偶尔有 breaking change,生产环境跟进要小心
  • 记忆系统 + MoA 多 Agent 并行会吃掉大量内存和 API token,成本是「基础账单 × Agent 数」
  • Web UI 只是基础版,日常管理主要靠 CLI 和配置文件,体验精致度远不如商业产品
相关对比

AutoGLM vs Manus:国产通用 Agent 怎么选

AutoGLM vs Manus 2026 选型对比:智谱开源 GUI Agent 与蝴蝶效应通用 Research Agent 的定位、Agent 能力、中文可用性、私有部署、价格和适合人群全方位对比。一个操作手机浏览器界面、一个云端产出深度报告,帮你判断该用哪个国产 Agent,以及能不能两个都用。

Devin vs Manus:AI Agent 怎么选?2026 对比

Devin vs Manus 2026 选型对比:Cognition 出品的自主 AI 软件工程师 vs Butterfly Effect 的通用 AI Agent。从定位、核心能力、自主程度、价格、国内可用性和适用场景 6 个维度帮你选对 AI Agent。

Dify vs Manus:Agent 平台 vs 通用 Agent 怎么选?2026 对比

Dify vs Manus 2026 选型对比:开源 LLMOps Agent 平台 vs Butterfly Effect 通用 AI Agent。从定位、核心能力、可定制性、开源、价格和适用场景 6 个维度帮你选对 Agent 工具。

Genspark vs Manus:通用 AI Agent 怎么选?2026 对比

Genspark vs Manus 2026 选型对比:Palo Alto 出品的多 Agent 全栈 Super Agent vs Butterfly Effect 的通用 Deep Research Agent。从定位、核心能力、模型支持、价格、国内可用性、适用场景 6 个维度帮你选对通用 AI Agent。

Hermes Agent vs Manus:开源自进化 Agent 对决通用 Agent 天花板,2026 怎么选?

Hermes Agent vs Manus 2026 选型对比:Nous Research 开源自进化 Agent(MoA+记忆系统+14 渠道部署)vs Butterfly Effect 通用 Agent 天花板(多 sub-agent 并行+多模型路由+小时级长任务)。从定位、核心能力、自主程度、价格、国内可用性、适用场景 6 个维度帮你选对 Agent。

Hermes Agent vs OpenClaw:Agent 框架 vs IM 网关(2026 实测选型)

Hermes Agent 和 OpenClaw 都是开源 AI Agent,但一个强调自进化 + 记忆 + 跨平台部署,一个强调 IM 网关 + 7×24 Heartbeat + Skills 市场。本文从定位、能力、价格、国内可用性帮你选对工具。