关键词:Hermes Agent / MOA / Mixture of Agents / 多模型协作

MOA(Mixture of Agents)是 Together AI 联合斯坦福、芝加哥大学、杜克大学于 2024 年提出的多模型协作推理架构,核心思路是:同时让多个参考模型独立回答问题,把它们的输出匿名后交给一个聚合模型合并提炼,最终得到超越任何单一模型的答案。论文(arXiv:2406.04692)在 AlpacaEval 2.0 上验证:纯开源模型组合的 MoA 得分 65.1%,超过 GPT-4 Omni 的 57.5%,同时在 MT-Bench 和 FLASK 达到 SOTA。Hermes Agent(Nous Research 出品)是目前对 MOA 支持最完整的 AI Agent 框架之一,内置 MoA 预设,三条命令可开启。本文覆盖 MOA 原理、Hermes 安装、MoA 配置、全本地方案和零成本云端方案两种玩法。

 

MOA 到底怎么工作?

传统 RAG 或单模型链(Chain of Thought)都是一问一答的线性结构——一个模型从头到尾独立负责。MOA 的不同在于引入了"多参考 + 单聚合"的并行层级架构:

 

用户问题
    │
    ├──▶ 参考模型 A(独立推理)
    ├──▶ 参考模型 B(独立推理)     ← 匿名化后传给聚合模型
    └──▶ 参考模型 C(独立推理)
                │
                ▼
           聚合模型(Aggregator)
                │
                ▼
          最终回答 + 工具调用

参考模型不接收工具 schema,只做"廉价咨询调用"——它们各自独立思考,互不知晓对方的输出。聚合模型看到的是经过匿名化的三份草稿加上原始问题,负责综合判断、写出最终回复并执行工具调用。

匿名化是关键设计:如果参考模型的输出带有"我是 GPT-5.5"这类身份信息,聚合模型会对某个品牌产生偏见,削弱多样性带来的增益。

为什么这能提升质量? 不同模型在不同类型问题上各有擅长——推理、代码、长上下文、创意写作。把它们并联后,弱点被互补,共识被强化,边缘错误被过滤。HermesBench 数据:双模型面板(Opus-4.8 + GPT-5.5 作参考)得分 0.8202,vs 单用 Opus-4.8 的 0.7607,提升幅度约 8%。

Hermes Agent 是什么?

Hermes Agent 是 Nous Research(以 Hermes 模型系列著称的 AI 研究机构)开源的 AI Agent 框架,MIT 协议,主要特点:

 自改进学习循环:复杂任务完成后自动创建技能,技能在使用中持续优化

 全平台覆盖:CLI / Telegram / Discord / Slack / WhatsApp / Signal,同一个 Agent 实例跨平台

 无厂商锁定:hermes model 命令一键切换任意 OpenAI 兼容提供商,不改代码

 内置 MOA 支持:配置文件里写好预设,/model xxx --provider moa 即可开启

 技能生态:兼容 agentskills.io 开放标准,社区技能可直接安装

相关技术实体:Ollama(本地模型运行)、Nous Portal(300+ 模型一站订阅)、FreeLLMAPI(16+ 免费提供商聚合)、agentskills.io(技能标准)。

安装 Hermes Agent

Linux / macOS / WSL2:

 

curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
source ~/.bashrc   # 或 source ~/.zshrc

Windows(原生 PowerShell):

 

iex (irm https://hermes-agent.nousresearch.com/install.ps1)

安装程序自动处理 uv、Python 3.11、Node.js、ripgrep、ffmpeg 依赖,Windows 上还会打包 MinGit(不需要管理员权限,不影响系统已有 Git)。

安装完成后:

 

hermes          # 启动交互 CLI
hermes doctor   # 诊断配置问题
hermes setup    # 运行完整配置向导

配置 MOA:最简路径

Step 1:选择模型提供商

 

hermes model

按提示选择提供商(Nous Portal / OpenRouter / OpenAI / 自定义端点均可)。国内开发者若需要多款主流模型统一接入,可以选择自定义端点并填入兼容 OpenAI 格式的 API 地址,如七牛云AI支持该接口格式,无需修改其他配置。

Step 2:在 ~/.hermes/config.yaml 添加 MoA 预设

 

moa:
  presets:
    default-moa:
      references:
        - model: qwen3-14b          # 参考模型 A(不同厂商)
          provider: openrouter
        - model: deepseek-r1        # 参考模型 B(不同厂商)
          provider: openrouter
      aggregator:
        model: gpt-5.5              # 聚合模型(综合能力最强)
        provider: openai

关键原则:参考模型选不同厂商。同一家厂商的两个模型犯的错误高度相关,多样性增益趋近于零;跨厂商模型的错误分布不同,聚合后才有真实增益。

Step 3:激活 MoA

 

hermes
/model default-moa --provider moa

之后所有对话都会走 MoA 流程:两个参考模型并行推理,聚合模型综合输出。

 

两种进阶玩法

玩法一:全本地 MOA(零 API Key,高硬件要求)

社区项目 InfiniteWhispers/HermesAgent-MultiModel 实现了完全本地的 8 模型 MoA 栈,通过 Ollama 在单机运行,无任何云依赖。

硬件要求:

 GPU:RTX 4080 / 5080(16 GB VRAM)

 RAM:48 GB+(64 GB 理想)

 存储:100 GB+ NVMe SSD

MoA 默认配置:

 参考模型:qwen3-14b-think + ornith-9b(SWE-Bench 69.4%)

 聚合模型:gpt-oss-20b(工具调用最优,23/25)

性能调优(写入 Ollama systemd 配置):

 

[Service]
Environment="OLLAMA_FLASH_ATTENTION=1"
Environment="OLLAMA_KV_CACHE_TYPE=q8_0"

KV Cache 建议:q8_0(25% VRAM 节省,吞吐量损失 <5%);q4_0 虽省 50% VRAM,但 64K 上下文下吞吐量损失高达 92%,不推荐。

玩法二:零成本云端 MOA(免费额度聚合)

社区项目 HERMES-Free-SOTA 通过 FreeLLMAPI(16+ 提供商免费额度聚合路由)+ Hermes MoA 实现近零成本的多模型协作。

已验证运行状态(2026-06-29,MacBook Pro M5 128GB):

 65 个可用模型,来自 9+ 模型家族

 MoA 预设:kimi-k2.6 + llama-3.3-70b + qwen3-coder-480b → 融合聚合器

 看门狗 cron:每 6 小时健康检查,故障时告警

 

# 安装 FreeLLMAPI
git clone https://github.com/tashfeenahmed/freellmapi.git && cd freellmapi
cp .env.example .env
npm install && npm run dev   # 控制台在 http://localhost:5173
 
# 在控制台 Keys 标签添加免费 API Keys(OpenRouter / Groq / Gemini / DeepSeek)
 
# 注册为 Hermes 自定义提供商
hermes model   # → 自定义端点 → http://localhost:3001/v1
 
# 激活免费 SOTA MoA 预设
hermes
/model free-sota --provider moa

模型选择原则(与具体名称无关):

1. 查询 FreeLLMAPI /v1/models 获取当前可用模型,按 intelligence_rank 排序

2. 聚合模型:排名最高者

3. 参考模型:从不同两个提供商家族各选一个排名最高的

4. 每月或大型模型发布后刷新一次

 

常用命令速查

 

hermes                          # 启动交互 CLI
hermes model                    # 切换 LLM 提供商和模型
hermes tools                    # 配置工具(Web 搜索、文件操作等)
hermes gateway setup            # 配置 Telegram / Discord 等消息平台
hermes gateway start            # 启动消息网关
hermes update                   # 更新到最新版本
hermes doctor                   # 诊断配置问题
hermes claw migrate             # 从 OpenClaw 迁移

会话内 slash 命令:

 

/new              新建对话
/model <name>     切换模型(支持 --provider moa)
/reset            重置当前会话

常见问题

Q:MOA 会增加多少延迟?

参考模型并行运行,延迟约等于"最慢的参考模型"而非所有模型之和。代价主要是 token 消耗增加(参考调用 × 参考模型数量)。对于需要高质量输出的场景(代码生成、复杂分析),这个代价通常值得;对于简单问答,单模型即可。

Q:参考模型数量越多越好吗?

不是线性关系。研究表明 2-3 个来自不同厂商的参考模型通常就能获得大部分增益,继续增加边际收益递减,但 token 成本线性增加。HERMES-Free-SOTA 的实测配置是 3 个参考模型 + 1 个聚合模型。

Q:Hermes Agent 和 OpenClaw 有什么关系?

Hermes Agent 是 NousResearch 开发的新一代 Agent 框架,hermes claw migrate 命令支持从 OpenClaw 配置迁移。两者定位相似但不是同一个项目,Hermes 新增了学习循环、技能自动创建等能力。

结语

MOA 的核心洞见是:协作推理比单模型扩展更高效——把同等算力分给多个多样化的模型并行思考,再让聚合模型综合,比把全部算力堆给一个更大的模型效果更好。论文数据(AlpacaEval 2.0:65.1% vs 57.5%)和 HermesBench 实测(0.8202 vs 0.7607)都指向同一个结论。

Hermes Agent 把这套架构封装成了三行命令可以开启的预设,全本地方案(Ollama + 8 模型)和零成本云端方案(FreeLLMAPI)都有社区验证的完整配置可以参考。

本文数据来源:arXiv:2406.04692、NousResearch/hermes-agent 官方 README、InfiniteWhispers/HermesAgent-MultiModel、HERMES-Free-SOTA,内容基于 2026 年 7 月。

 

延伸资源

 Hermes Agent 官方文档:https://hermes-agent.nousresearch.com/docs/

 Hermes Agent GitHub:https://github.com/NousResearch/hermes-agent

 MOA 原论文:https://arxiv.org/abs/2406.04692

 本地全栈方案:https://github.com/InfiniteWhispers/HermesAgent-MultiModel

 七牛云 AI 推理服务(OpenAI 兼容接口):https://www.qiniu.com/ai/plan