硬核实测!ollama 运行 Qwen3.5、Qwen3.6、Gemma4 谁答高考数学更强
2026 年高考已经落下帷幕,但属于开源大模型的「高考实战测评」才刚刚拉开序幕。
2026 年高考已经落下帷幕,但属于开源大模型的「高考实战测评」才刚刚拉开序幕。
我梳理了今年的全国卷数学考题,发现整套选择题没有配图类题目,纯文本形式非常适合做大模型能力基准测试。我把题目整理成了「一行题干、一行对应答案与分值」的格式,方便程序自动判分。本次测试选题总分合计 58 分,正好用来检验这几款模型的应试水平。

测试环境还是我们的老配置:Windows 系统 + CUDA12 + RTX 3090 24G 显卡,运行自研的 olala-test 测试脚本。本次参评的三款同量级开源模型分别是:qwen3.5:27b、qwen3.6:27b、gemma4:26b。
原本打算逐个模型依次跑测记录,后来干脆让 DeepSeek 帮忙写了一套循环批量打分程序,直接读取接口输出结果即可,省了不少事。
正式进入测试环节 —— 全程不会向模型泄露答案,保证测试公平性。

我看了一下请求:

没有把答案告诉模型,很好。可以开始了
第一段:qwen3.5:27b:总耗时 1302 秒,拿下 58 分满分,换算百分制为 100 分

- 第二段:qwen3.6:27b:总耗时 826.58 秒,同样拿下 58 分满分,换算百分制为 100 分

两款千问模型双双满分,我一度怀疑是不是程序不小心给模型透了答案,直到 Gemma4 的结果出来才打消了顾虑:
- 第三段:gemma4:26b:总耗时 2255 秒,最终得分 26 分,换算百分制为 45 分

测试结果一览
模型
得分(58分制)
百分制
总耗时
🥇 qwen3.6:27b
58/58100 分826.58 秒
🥈 qwen3.5:27b
58/58100 分1302 秒
🥉 gemma4:26b
26/5845 分2255 秒
本次测试中,qwen3.5:27b 和 qwen3.6:27b 都实现了 58 分满分通关,选择题全部答对,换算百分制均为 100 分。qwen3.6 不仅没有因为提速而牺牲准确率,反而做到了“又快又准”。
相比之下,gemma4:26b 仅获得 26 分,正确率约为 44.8%,换算后约 45 分。
gemma4:26b 是MoE 架构,每次激活少,理论上激活参数更少本应推理更快,除了一个异常调度外。其他答题速度确实快。也是因为激活参数少,他的正确性也无法没稠密模型对比了。
如果是你,你会选择什么模型呢,欢迎留言评论,也可以加微信进群,交流模型部署技巧,少走弯路,一起学习开源大模型落地应用!

本文转载自微信公众号,如有侵权请联系删除。
- 标题: 硬核实测!ollama 运行 Qwen3.5、Qwen3.6、Gemma4 谁答高考数学更强
- 作者: lxiol
- 创建于 : 2026-06-20 01:24:23
- 更新于 : 2026-06-20 01:24:23
- 链接: https://blog.lxiol.cn/2026/06/20/硬核实测ollama-运行-Qwen35Qwen36Gemma4-谁答高考数学更强/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。