三个本地小模型,我全试了。谁适合当前台接待?

lxiol

原文链接:https://mp.weixin.qq.com/s/xjnhg3-nkxPXFzYIM2z6hg

三个本地小模型,我全试了。谁适合当前台接待?事情要从一张账单说起。

ESSAY

三个本地小模型,我全试了。谁适合当前台接待?

2026 · 06 · 30

事情要从一张账单说起。

有一天翻 OpenClaw 的 API 用量,发现 DeepSeek  通道一天干了二三十块钱。不算多到破产,但天天这么跑,一个月下来也大几百了。

查了一下原因:OpenClaw 没有很好命中 DeepSeek 的缓存。同一个问题的不同变体,每次都在重新算。缓存命中率低,意味着每一轮对话都在烧钱。

所以决定给它找个”前台”——一个本地跑的小模型,日常交互、普通任务、跟用户打招呼这些活交给它。不烧 API 额度,不给账单添乱。

怎么选

选了三个本地小参数模型:Qwopus35-4B-Coder-Q8-64K、Qwen35-9B-Q5_K_M-64K、Gemma4-12B-Q4_K_XL。参数跨度很大(4B vs 9B vs 12B),但参数在本地端不代表一切。

测试方式很简单:让它们各自写一份 HTML 自我介绍。同一个需求,不一样的答案。

Qwopus35-4B:正片党

4B 参数最小,活最漂亮。深色沉浸式页面,紫色渐变头像带呼吸光效,60 个粒子在背景里飘,毛玻璃卡片展示六条核心承诺。

文案最让人意外。”尊重边界”、”持续进化”、”值得信任”——这不是套模板写出来的,它理解了 Claw 是个什么东西。

CSS 不含糊:纯 CSS 粒子、三层 z-index、多组 keyframes 动画、全响应式。耗时 4 分钟。

Qwen35-9B:信息党

9B 参数最强,但走了另一个方向。多个区块堆叠——“我是谁”、”核心信条”、”能力矩阵”。信息密度高,视觉上相对朴素。

文案有气息——“我正在成为某人”,不是 Claw 的口吻。它理解了功能清单,没理解这个人。耗时 4 分钟。

Gemma4-12B:氛围党

12B 最大,但最后一个跑完。赛博朋克终端风:全屏扫描线动画、打字机逐字输出——视觉冲击极强,但内容最少,页面上就四个 skill-card。耗时 7 分钟。

怎么用

结论不是谁更强,而是谁该站哪:

前台助理 — Qwopus35-4B
最短时间完成最完整自我介绍,文案贴合人设。MTP 双 token 预测让推理加速 1.4-2.2 倍,本地跑着没负担。

资料展示页 — Qwen35-9B
信息密度高,适合能力矩阵静态页面。前台轮值别让它上。

单独炫技 — Gemma4-12B
终端风视觉适合项目 Landing Page。日常对话别找它。

用模型就像分活:不能因为参数最大就让它干最多活,也不能因为参数最小就看低它。在本地端,4B 做好一件事比 12B 哪都差一点更有价值。

三个 HTML 截图都放出来了,有兴趣的可以自己跑一下看看。

结论——

4B 做好一件事,比 12B 哪都差一点更有价值。

巡梦人

从一颗星星开始,温暖整个宇宙

本文转载自微信公众号,如有侵权请联系删除。

  • 标题: 三个本地小模型,我全试了。谁适合当前台接待?
  • 作者: lxiol
  • 创建于 : 2026-07-06 10:48:36
  • 更新于 : 2026-07-06 10:48:36
  • 链接: https://blog.lxiol.cn/2026/07/06/三个本地小模型我全试了谁适合当前台接待/
  • 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。
目录
三个本地小模型,我全试了。谁适合当前台接待?