Hermes新功能MoA :超过Opus 4.8和GPT-5.5

lxiol

原文链接:https://mp.weixin.qq.com/s/nGP-qcG-DZFKg_wZHrEpaA

过去几年,整个 AI 行业在做一件事:造最聪明的那个大脑。

过去几年,整个 AI 行业在做一件事:造最聪明的那个大脑。


自从ChatGPT 火了后,所有人铆足劲儿训练自己的大模型。GPT、Claude、Gemini、Qwen、DeepSeek。一家接一家,参数越堆越大,benchmark 越刷越高。

大家默认认为:谁拥有最强单个模型,谁就赢了。

但这个假设,到现在开始有点儿松动了。

6 月,Nous Research 在 Hermes Agent 里上线了一个叫 MoA 的功能。表面上看,它只是模型列表里多了一个选项。但实际上,它代表的方向是——让多个模型组队工作。


01

大家都在追”最强模型”

为了大家理解顺畅,先回到那条所有人都走过的路上。

2022 年底 ChatGPT 爆了之后,AI 行业进入了一个狂奔期。OpenAI 从 GPT-3.5 一路迭代到 GPT-4、GPT-4o、GPT-5 系列。Anthropic 从 Claude 1 追到 Claude 2、Claude 3、Opus 4 系列。Google 把 Bard 推倒重来,换成了 Gemini。咱国内这边,Qwen、GLM、Kimi 的更新频率也极高。

所有人都往同一个方向上用力:造一个更强更牛的单模型。

什么叫”更强”?参数更多,训练数据更大,推理能力更好,benchmark 分数更高。

背后逻辑很简单:既然一个聪明的 AI 已经这么好用了,那更聪明的版本当然更好用。于是 OpenAI 做 GPT-5,Anthropic 做 Opus 4.8,Google 做 Gemini 3。每家都在追那个”单挑最强”的皇冠。

但问题在于,这个方向已经开始碰到天花板了。
02

单个模型,一直都有天花板

不管你用哪个模型,都逃不开一个事实:没有任何模型在所有维度上都是第一。

GPT 的代码能力很强,但长文本处理不如 Claude。Claude 的理解深度是一绝,但多模态能力 Gemini 更全面。DeepSeek 的推理能力不输前两位,而且便宜得多。但它在多语言任务上的表现就不如 Qwen 稳定。Qwen 中文最好用,但英文生态的覆盖还差一口气。

这还只是”能力维度”。加上成本、速度、隐私、可用性——没有任何一个模型能同时满足所有条件。

更关键的是:这不是”再多训一训就能追上”的问题。

每个模型的能力边界,是它的训练数据、架构选择、优化目标共同决定的。DeepSeek 的 MoE 架构天然省算力但路由有偏差,GPT 的 dense 架构更稳定但推理成本更高。这些是设计层面的取舍,不是 bug。

所以问题来了:有没有别的打发?MoA 的回答是:别挑了,全都要。
03

MoA 到底是什么?

MoA,全称 Mixture of Agents(模型混合),是 Together AI 在 2024 年 6 月的一篇论文里提出的概念。

核心思想很简单:让多个模型分别回答同一个问题,然后让一个”裁判模型”综合所有人的答案,给出最终结论。

流程是这样的:

  • 用户提出问题
  • 多个”参考模型”(Reference Models)各自独立回答
  • 一个”聚合模型”(Aggregator)读取所有人的答案
  • 聚合模型综合各家的长处,生成最终回复

这里面有三个关键角色。

参考模型负责提供多样化的视角。在 Hermes 的实现里,参考模型是四家顶尖厂商的旗舰:Claude Opus、Gemini、GPT、DeepSeek。四个模型,四种思路,四种优势。

聚合模型的角色最特别。它不直接回答用户的问题。它先读所有人的答案,然后再做决定。为什么?因为它不是来”表达观点”的,它是来”判卷”的。它的任务是在四个答案中找到共识、抓住矛盾、发现盲点。然后输出一个比任何单个答案都更完整的综合版本。

提问者还是你。MoA 不改变用户的使用方式。你还是像跟任何一个模型聊天一样提问。背后的”专家组讨论”全自动完成。

有人会问:这不就是多模型投票吗?

不是。投票是”多数说了算”,MoA 是”综合所有人的智慧再判断”。聚合模型不只是统计谁说了什么——它需要理解每个答案的推理过程,判断哪个部分的论证更强,然后在综合时做出取舍。这比投票难得多,也有效得多。
04

为什么多个 AI 一起思考,会更强?

这个问题,其实人类世界早有答案。

咱有时候去医院看大病,主治医生不会一个人拍板。会诊。多个科室的专家坐在一起,各自从自己的角度分析病情,最后综合出一个方案。单科室误诊率也许有 15%,多科室会诊能把误诊率压到个位数。

你去打官司,律所不会只派一个律师。团队作业,有人负责证据梳理,有人负责法律论证,有人负责庭审策略。单打独斗的律师可能漏掉一个关键判例,团队能互相补位。

软件工程的 code review,建筑设计的方案评审,投资决策的投委会——同一个模式反复出现:多个有差异的专家,比一个最强的专家更可靠。

MoA 在 AI 领域复刻的,就是这个逻辑。它利用了三个关键机制:

多样性(Diversity)。四个参考模型来自四家不同的公司,训练数据不同,架构不同,优化目标不同。这意味着它们在同一道题上犯同样错误的概率极低。GPT 可能在代码逻辑上卡住,但 DeepSeek 刚好补上——因为它们的”盲区”不重叠。

独立推理。每个参考模型在回答时看不到其他模型的答案。这避免了”锚定效应”:先看到别人的答案再回答,容易被第一个答案带偏。独立推理保证了每个模型的输出是它自己的真实判断,不是”被带节奏”的从众反应。

交叉验证 + 最终裁决。聚合模型读完全部答案后,能识别出三种信号:共识(四个模型都同意)、矛盾(两个说 A 两个说 B)、盲点(某个模型想到了其他三个都漏掉的点)。共识直接采纳,矛盾需要判断,盲点是聚合模型真正增值的地方。它能帮用户抓到”单个模型用一辈子都可能想不到的角度”。

Together AI 的原论文里有一个很有说服力的实验。让同一个模型在多轮”对话”中不断看到其他模型的输出,它的 AlpacaEval 2.0 胜率会持续爬升。模型看到同行的答案后,自己给出的答案质量更高。这就是论文提出的”collaborativeness”(协作性)概念。

换句话说,不是聚合模型有多强。是”看到别人怎么想的”这件事本身,就能让模型变强。
05

MoA 和 Agent,到底是什么关系?

很多人容易把这两个概念搞混。

Agent 负责干活。它的核心能力是规划、调用工具、执行任务、记住上下文、多轮迭代。Agent 像一个项目经理。接到需求后,它会拆解任务、调用代码执行、读写文件。搜索信息、调用 API。在一轮轮交互中把活干完。

MoA 负责想办法。它的核心能力是思考、推理、生成答案。MoA 像一个专家委员会。不直接动手写代码,不调用工具,不管文件系统。它只做一件事:想清楚问题,给出最好的答案。

所以 Hermes 的设计是:Agent 框架里嵌入 MoA 作为推理引擎。Agent 的循环不变,该调工具调工具,该多轮迭代多轮迭代。但在”需要思考”的环节,调用的不是单个模型,而是一组模型协作。

为什么要这样设计?因为 Agent 最脆弱的地方,恰好是 MoA 最能帮上忙的地方。

Agent 的可靠性取决于每一步的推理质量。规划错了,后续全歪。工具调错了,任务直接失败。MoA 用多模型交叉验证来兜底推理质量,相当于在 Agent 的大脑里加了一层质检。

这也是为什么 Hermes 的 MoA 只允许聚合模型调用工具。参考模型只负责给建议,最后拍板、调动工具的永远是那一个人。
06

Hermes 为什么现在才做 MoA?

MoA 这个概念,2024 年 6 月就有了。Hermes 到 2026 年 6 月才把它做成产品。中间差了整整两年。

不是技术难度。MoA 的架构本身不复杂,参考模型 + 聚合模型两段式,Together AI 的原论文已经给了完整的实现方案。

真正花时间的,是把 MoA 从一个”研究 demo”变成一个”Agent 能用起来的组件”。

第一件事:模型选择。论文里的参考模型可以随便组合。但在产品里,选哪几个模型直接决定了 MoA 的质量和成本。Hermes 最终定了四家。Anthropic、Google、OpenAI、DeepSeek。覆盖了不同的架构风格和能力侧重,同时把单次推理成本控制在合理范围。

第二件事:虚拟模型(Virtual Model)。这是 Hermes 做得最聪明的地方。MoA 不是一个模型。它是一套工作流。但在 Hermes 的模型列表里,MoA 预设和其他模型(GPT、Claude、Gemini)并列出现。用户选 MoA,就像选任何一个模型一样。背后的四个模型轮流调用,用户完全无感。

第三件事:工具调用权限。在 Agent 场景里,如果四个参考模型都能调工具,那画面会很混乱。一个调终端,一个调浏览器,一个读写文件,一个搜索网页。四套操作同时进行,互相覆盖。Hermes 的解决方案很干净:只让聚合模型调工具。参考模型只给文字建议,不能动手。

第四件事:Token 和成本。每次用户提问,MoA 要调用 5 次 API。4 个参考模型 + 1 个聚合模型。这比单模型调用贵几倍。Hermes 的策略是用预配置的预设(Preset)来管理。用户不需要每次手动选模型,直接切到 MoA 模式就行。


07

为什么 Benchmark 会变高?

HermesBench 的数据是:MoA 预设比 Claude Opus 4.8 高 8%,比 GPT-5.5 高 11%。

数字本身没什么好说的。有意思的是”为什么”。

假设你在写一个复杂的数据分析脚本。你问了 GPT,它给的规划很好。先清洗数据,再选特征,最后建模。但代码里有个 bug:Pandas 的 groupby 语法写错了。

你又问了 DeepSeek。它的代码没问题,groupby 写得干净。但它的规划思路偏了。它选了三个特征,其中两个跟你实际需要的不太搭。

这时候聚合模型上线了。它看到了两个答案。GPT 版:规划好,代码差。DeepSeek 版:代码好,规划偏。于是它做了个简单的减法。**规划用 GPT 的框架,代码用 DeepSeek 的实现。**最终答案用 Claude Opus 4.6 的叙述风格整合输出。

单模型做这件事会怎样?GPT 会坚持自己的代码,DeepSeek 会坚持自己的规划。它们各自都觉得自己的方案没问题。聚合模型不会。它没有”自己的答案”要捍卫。它的唯一目标是从四个答案里挑最好的部分组起来。

这就是 MoA 的 benchmark 变高的核心机制:不是任何一个模型变强了,是组合在一起后,每个模型的短板被其他模型的长板补上了。

Agent 任务尤其受益。Agent 任务通常链式依赖。规划→执行→检查→修正,任何一步出错整条链断掉。MoA 在关键推理节点上做了多重验证,相当于给每个决策加了一层保险。
08

整个 AI 行业都在走向”多模型协作”?

Hermes 不是唯一在做这件事的人。

Google 的 Gemini 团队在去年的一系列技术博客里探索过”模型委员会”的架构方向。OpenAI 这边,据行业分析,GPT-5 系列内部也在尝试多模型路由。不同子任务调用不同大小的模型,复杂任务再上大模型。

Anthropic 走了另一条路:Claude 的 system prompt 和 tool use 机制本身就在模拟”多角色协作”。同一个模型在同一次对话里扮演规划者、执行者、检查者三种角色。不是多模型,但思想类似。

DeepSeek 的 MoE(Mixture of Experts)架构,本质上也是”多个子模型协作”。只是粒度更细,在模型内部而非外部。

甚至更早的。2023 年开始流行的 AutoGPT、MetaGPT、CrewAI 等 Multi-Agent 框架。虽然实现粗糙,但底层信仰是一样的:多个 AI 协作,比一个 AI 单干更好。

你会发现一个很有意思的现象:各家走的路线不同,但终点在趋同。

Google 是”委员会模式”,Anthropic 是”多角色模式”,DeepSeek 是”内部协作模式”,Hermes 是”外部集成模式”。路径各异,但大家都不再相信”一个最强模型解决一切”了。

原因很简单:训练一个通用超强模型的成本太高了。据行业估算,GPT-5 级别的模型训练成本在 10 亿美元量级。而把几个已有的强模型组合起来,成本低几个数量级,效果却可能更好。

从经济学角度看,这也是一个必然趋势。当边际成本递增、边际收益递减时,系统级优化比模型级优化更划算。把现有能力重新组合,比继续加大训练投入更聪明。
09

MoA 会不会成为未来 Agent 的标配?

如果咱回头看看过去一年发生的事儿,Skills(技能积累)、Memory(跨会话记忆)、Profile(多身份隔离)、Sub-Agent(子任务代理)、MCP(工具协议)。

Agent 正在从一个”对话机器人”变成一个”系统”。

MoA 是这个系统里最新加入的一块拼图。它想解决的是拼图上最核心的一块:推理可靠性。

把现有已经跑通的能力串起来看。Memory 让 Agent 记住你是谁、你的偏好、你的历史。Skills 让它积累可复用的经验和工作流。Profile 让同一套系统服务不同身份和场景。Sub-Agent 让它把大任务拆成小任务并行处理。MCP 让它能接入各种外部工具和数据源。MoA 做的是最后一步。在这些能力之上,加一个推理质量保险层。

未来的 Agent,会越来越不像”一个 AI”。

更像一家数字公司。

有一个”CEO”,也就是主 Agent 的规划模块。下面挂着一组专家模型,MoA 做推理保障。每个专家能调自己的工具,MCP 接入。有专职子 Agent 执行具体任务。跨项目保留经验,靠 Skills。对每个客户分别记住偏好,靠 Memory 和 Profile。

这条演进路线走到头,AI 行业的竞争会从”谁的模型更强”变成”谁的系统更完整”。

MoA 是这条路上一个小的里程碑。但它背后的逻辑。承认单个模型的天花板,转向多模型协作。是整个行业迟早要过的坎。

过去几年,大模型竞争的主题是谁拥有最强的单个模型。MoA 代表着另一种可能的方向:让不同模型组成团队,通过协作获得更强的整体能力。Hermes 厉害的不仅仅是它发布了一个新功能。而是它把这种协作机制,做成了普通用户可以直接使用的能力。

等下次你打开 Hermes 的模型列表,看到一个叫 MoA 的选项时,你就知道它背后在发生什么了——不是一个模型在回答你,而是四个,外加一个裁判。

另外Hermes 联合创始人发话他们正在测试各种便宜model的组合,看是否能用便宜的MoA达到Opus模型的能力👇🏻

Hermes 的新功能 /learn:把互联网变成 Agent 的训练场

NVIDIA 80+大模型可白嫖?Hermes 已薅上

吃灰电视盒子养马,装 Hermes agent 后变身 AI 助理

Hermes 官方也能白嫖?半年偷偷送了 6 波

换了 Hermes 5 个配置,Token 账单直接砍半

一个人指挥一群 AI 干活:Hermes Kanban 从零到跑通

Hermes Agent 本地部署指南:零成本跑之前先看完这篇

Hermes Agent 完全指南:从零搭建一个会自我进化的 AI 员工

Hermes 接入 OpenRouter,3 分钟白嫖 23 个免费大模型

旧安卓手机装个 Hermes Agent,低成本养一匹 AI 马

参考来源

  • • arxiv.org/abs/2406.04692 — Wang et al., “Mixture-of-Agents Enhances Large Language Model Capabilities” (2024.6)
  • • hermes-agent.nousresearch.com/docs/user-guide/features/mixture-of-agents — Hermes MoA 官方文档
  • • github.com/NousResearch/hermes-agent/issues/38952 — MoA 参考模型与 aggregator 配置
  • • alphasignal.ai — HermesBench MoA 性能数据
  • • together.ai/blog/together-moa — Together AI MoA 博客

💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: Hermes新功能MoA :超过Opus 4.8和GPT-5.5
  • 作者: lxiol
  • 创建于 : 2026-06-28 18:41:12
  • 更新于 : 2026-06-30 17:05:34
  • 链接: https://blog.lxiol.cn/2026/06/28/Hermes新功能MoA-超过Opus-48和GPT-55/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。