换了 Hermes 5 个配置,Token 账单直接砍半

lxiol

原文链接:https://mp.weixin.qq.com/s/HCxRWFPluyq4CSH2K7xhJQ

近一半的 Token 花在了你根本想不到的地方——标题生成、视觉识别、上下文压缩。换了 Hermes 5 个配置,账单直接砍半。

最近翻了一下 Hermes 的 Token 使用统计,发现一个让我坐不住的数字——将近一半的 Token,花在了我根本想不到的地方。

几周前我翻了翻 Hermes 的 Token 用量统计,发现一个让我愣住的数字。

标题生成占了 8%,视觉识别占了 12%,上下文压缩又吞了 15%。

这三个任务加起来,快赶上我正经用 GPT-5 写代码的消耗了。

我干了件什么事呢?

让最贵的模型帮我起文章标题。让最贵的模型帮我看截图里有没有报错。让最贵的模型帮我把聊天记录压缩成摘要。

这让我随手就想起一个画面。叫了一辆法拉利,让它去送外卖。

这个浪费不是我的问题——Hermes 默认就是这么干的。(其实是我没配置好~)

我们装好 Hermes后,一般就选一个主模型,然后它就把所有事情都交给这个模型。聊天、起标题、看图、压缩上下文、判断命令风险、提取网页内容,全部塞给同一个模型。

查看hermes官方文档后发现, Hermes 其实偷偷留了 11 个后门。
01

主模型 + 11 个辅助模型

Hermes 在背后把 Agent 的工作拆成了 12 个独立的模型槽位。

1 个主模型负责跟你对话,11 个辅助模型负责你看不见的脏活累活。

默认全部走主模型,但每一个都可以单独替换。

这 11 个辅助任务包括:标题生成、视觉识别、上下文压缩、命令审批、网页提取。

还有 Skills Hub 搜索、MCP 工具路由、Triage 任务分派、Kanban 任务拆解、Profile 描述、Curator 技能审查。

你用 hermes config edit 打开配置文件,会看到这样的结构:

1
2
3
4
5
6
7
8
9
10
`auxiliary:
  title_gen:
    provider: auto    # 默认:走主模型
    model: ''
  vision:
    provider: auto
    model: ''
  compression:
    provider: auto
    model: ''`

provider: automodel:'',意思就是”这事交给主模型”。

Hermes 的官方文档说得直白。标题生成、上下文压缩、命令审批这些高频任务,用便宜的 flash 模型就够了,效果没差。

但说实话,11 个槽位不是每个都需要换。真正值得换的,是其中 5 个。
02

5 个最值得换的槽位

1. 标题生成

每开一个新对话,Hermes 会自动根据聊天内容起个标题。起标题这件事,让 GPT-5 来干就像让院士帮你起网名。能起,但完全没必要。

换成 Gemini Flash 或任何 flash 级模型,标题质量几乎一样。我换了之后翻看了两周的标题,没一个需要改的。

配置:title_gen.provider: openrouter, model: google/gemini-3-flash-preview

2. 视觉识别

你发给 Hermes 的截图、UI 设计稿、PDF 页面、代码报错。它需要”看懂”再回答你。看图这件事,Gemini Flash 的视觉能力和 GPT-5 的差距远比你想象的小。

尤其是报错截图、界面识别这类常规任务。Flash 和 Opus 的准确率差别在个位数百分比,价格却差了 100 倍。

配置:vision.provider: openrouter, model: google/gemini-2.5-flash

换完之后拿几张你常见的截图测一下。

我测了一张复杂的控制台报错和一张设计稿,Flash 都准确识别了。如果遇到它搞不定的图,偶尔切回主模型也不会毁掉你的预算。

3. 上下文压缩

你跟 Hermes 聊得久了,上下文窗口快满了。它得把前面的对话压缩成摘要才能继续用。这个操作的频率比你想象的高:每 50-100 轮对话可能触发一次。

摘要不需要创造力,不需要深度推理。它只需要把关键信息拎出来。用 haiku 或 flash 级模型就够了。

配置:compression.provider: openrouter, model: anthropic/claude-3.5-haiku

压缩之后回翻一下旧对话,确认关键信息没丢。我测了一周,没发现一次压缩导致上下文丢失的问题。

4. 命令审批

如果你开了 approval_mode: smart,Hermes 在执行危险命令前会让一个模型先判断风险等级。

这个判断不需要 GPT-5 的智力。它只需要判断”这个 rm -rf 是不是高危命令”。三岁小孩都能干。

配置:approval.provider: openrouter, model: google/gemini-3-flash-preview

测试方法:在测试目录里跑几个危险命令,看看审批模型是否照样拦截。我的测试里,flash 模型的拦截率跟主模型完全一样。

5. 网页提取

你用 Hermes 浏览网页、抓取文档时,web_extract 这个工具在后台运行。

它的任务是把 HTML 转成纯文本——纯体力活。用一个比你主模型便宜 50 倍的模型去提取文本,质量几乎没有差别。

配置:web_extract.provider: openrouter, model: anthropic/claude-3.5-haiku

提取完之后看一眼内容完整性。我测了几个技术博客和文档页,提取质量跟主模型没有肉眼可见的差别。

怎么配

打开 Hermes Dashboard → 左侧 Models → 点 Show auxiliary 展开全部 11 个槽位 → 逐个点 Change,选 provider 和模型 → 点 Switch 保存。

改完只对新会话生效,已经打开的聊天不受影响。想立刻在聊天里测试的话,用 /model 斜杠命令热切。


03

算一笔账

以下数字基于典型日用量估算。假设你每天 50 轮对话,每轮平均 2000 Token 上下文。主模型用 GPT-5($15/1M input, $75/1M output,OpenRouter 定价),flash 模型取 Gemini Flash($0.10/1M input, $0.40/1M output,OpenRouter 定价)。

换完上面 5 个槽位之后:

  • 标题生成:每天 20 次 × 每次 ~200 Token ≈ 每天 4000 Token。换 flash 后月省 ≈ $12
  • 视觉识别:每天 10 张图 × 每张 ~500 Token ≈ 每天 5000 Token。换 flash 后月省 ≈ $25
  • 上下文压缩:每天触发 2-3 次 × 每次 ~3000 Token ≈ 每天 8000 Token。换 haiku 后月省 ≈ $18
  • 命令审批 & 网页提取:量不大但零碎,加起来月省 ≈ $8

五项合计,一个月能省 $60-80。如果你的主模型是 Claude Opus(价格更高),省得更多。

换完这 5 个槽位花了我 5 分钟。省下来的钱,够再开一个 GPT-5 订阅。
04

但不是所有槽位都该换

上面 5 个槽位有一个共同点。它们的任务不需要主模型的深度推理能力。起标题、看图、摘要、判断风险、提取文本。换便宜模型,效果几乎不变。

剩下的 6 个槽位不太一样。

Skills Hub 搜索、MCP 工具路由、Triage 任务分派。

这些任务涉及判断该调用哪个工具、把任务分给哪个子 Agent。判断错了会直接影响主任务的执行质量。我的建议是保持默认,走主模型。

Kanban 分解和 Curator 审查。调用频率低但执行时间长。如果主模型是推理模型(如 Claude Opus + extended thinking),让推理模型去分解任务可能耗时几分钟。这种情况建议切成便宜模型。但如果主模型本身就是快速模型,换不换差别不大。

Profile 描述基本不调用。不值得费心。

一个判断标准:这个任务的输出,会影响你的核心工作结果吗?

会影响 → 保留主模型。不会影响、只是一个辅助动作 → 果断换便宜模型。

如果拿不准某个槽位该不该换,先换,用一个星期,看看效果。不行随时切回来。Hermes 的换模型不需要重启,Dashboard 里点两下就切了。

上面这个判断方法可以存一下——下次打开 Hermes Dashboard,找到 Models 页面点「Show auxiliary」,花 5 分钟把这几个槽位换了。你算过自己每个月在这些看不见的边角料上浪费了多少 Token 吗?评论区聊聊。

一个人指挥一群 AI 干活:Hermes Kanban 从零到跑通

Hermes Agent 本地部署指南:零成本跑之前先看完这篇

Hermes Agent 完全指南:从零搭建一个会自我进化的 AI 员工

Hermes 接入 OpenRouter,3 分钟白嫖 23 个免费大模型

参考来源

  • • hermes-agent.nousresearch.com/docs/user-guide/configuring-models
  • • OpenRouter 模型定价页(openrouter.ai/models)

💬 本文评论区已开启,但暂无读者留言。

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 换了 Hermes 5 个配置,Token 账单直接砍半
  • 作者: lxiol
  • 创建于 : 2026-06-15 17:13:11
  • 更新于 : 2026-06-30 17:05:34
  • 链接: https://blog.lxiol.cn/2026/06/15/换了-Hermes-5-个配置Token-账单直接砍半/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。