三个本地小模型,我全试了。谁适合当前台接待?
三个本地小模型,我全试了。谁适合当前台接待?事情要从一张账单说起。

ESSAY
三个本地小模型,我全试了。谁适合当前台接待?
2026 · 06 · 30
事情要从一张账单说起。
有一天翻 OpenClaw 的 API 用量,发现 DeepSeek 通道一天干了二三十块钱。不算多到破产,但天天这么跑,一个月下来也大几百了。

查了一下原因:OpenClaw 没有很好命中 DeepSeek 的缓存。同一个问题的不同变体,每次都在重新算。缓存命中率低,意味着每一轮对话都在烧钱。
所以决定给它找个”前台”——一个本地跑的小模型,日常交互、普通任务、跟用户打招呼这些活交给它。不烧 API 额度,不给账单添乱。
怎么选
选了三个本地小参数模型:Qwopus35-4B-Coder-Q8-64K、Qwen35-9B-Q5_K_M-64K、Gemma4-12B-Q4_K_XL。参数跨度很大(4B vs 9B vs 12B),但参数在本地端不代表一切。
测试方式很简单:让它们各自写一份 HTML 自我介绍。同一个需求,不一样的答案。
Qwopus35-4B:正片党
4B 参数最小,活最漂亮。深色沉浸式页面,紫色渐变头像带呼吸光效,60 个粒子在背景里飘,毛玻璃卡片展示六条核心承诺。
文案最让人意外。”尊重边界”、”持续进化”、”值得信任”——这不是套模板写出来的,它理解了 Claw 是个什么东西。

CSS 不含糊:纯 CSS 粒子、三层 z-index、多组 keyframes 动画、全响应式。耗时 4 分钟。
Qwen35-9B:信息党
9B 参数最强,但走了另一个方向。多个区块堆叠——“我是谁”、”核心信条”、”能力矩阵”。信息密度高,视觉上相对朴素。
文案有气息——“我正在成为某人”,不是 Claw 的口吻。它理解了功能清单,没理解这个人。耗时 4 分钟。

Gemma4-12B:氛围党
12B 最大,但最后一个跑完。赛博朋克终端风:全屏扫描线动画、打字机逐字输出——视觉冲击极强,但内容最少,页面上就四个 skill-card。耗时 7 分钟。

怎么用
结论不是谁更强,而是谁该站哪:
前台助理 — Qwopus35-4B
最短时间完成最完整自我介绍,文案贴合人设。MTP 双 token 预测让推理加速 1.4-2.2 倍,本地跑着没负担。
资料展示页 — Qwen35-9B
信息密度高,适合能力矩阵静态页面。前台轮值别让它上。
单独炫技 — Gemma4-12B
终端风视觉适合项目 Landing Page。日常对话别找它。
用模型就像分活:不能因为参数最大就让它干最多活,也不能因为参数最小就看低它。在本地端,4B 做好一件事比 12B 哪都差一点更有价值。
三个 HTML 截图都放出来了,有兴趣的可以自己跑一下看看。
结论——
4B 做好一件事,比 12B 哪都差一点更有价值。
巡梦人
从一颗星星开始,温暖整个宇宙
本文转载自微信公众号,如有侵权请联系删除。
- 标题: 三个本地小模型,我全试了。谁适合当前台接待?
- 作者: lxiol
- 创建于 : 2026-07-06 10:48:36
- 更新于 : 2026-07-06 10:48:36
- 链接: https://blog.lxiol.cn/2026/07/06/三个本地小模型我全试了谁适合当前台接待/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。