1107 token/s!刚刚,谷歌开源 DiffusionGemma,本地大模型速度起飞
每秒 1107 个 token vs 303 个。同一张 H100 显卡。同一个 26B 参数架构。
每秒 1107 个 token vs 303 个。
同一张 H100 显卡。同一个 26B 参数架构。303 那个还开启了多 token 预测加速。
DiffusionGemma,谷歌刚刚发布的新模型,比标准版 Gemma 4 快了将近 4 倍。
它不再一个一个 token 往外蹦了。256 个 token,同时生成。
完全开源,Apache 2.0 协议。

目前主流大模型生成文字的方式,都像打字机。
一个一个 token,从左到右,前一个出来了才能生成下一个。GPT 这样,Claude 这样,DeepSeek 也这样。这种方式叫「自回归」。
但本地运行模型的时候,这种方式有个天然的瓶颈。「GPU 大部分时间在等上一个 token 算完,才能算下一个。」算力利用率低,显卡在空转。
云端可以同时接几千个用户的请求,把 GPU 喂满。但本地只有你一个人用,速度上不去。
DiffusionGemma 换了一条路。
图片模型生图,一开始都是一张噪点图,然后一步步去噪,最终变成清晰的画面。DiffusionGemma 把同样的思路搬到了文字上。
一开始,它先生成 256 个随机占位符。然后反复迭代。每一轮把已确定的 token 锁住,用它们当线索,修正剩下的。几轮下来,一整段文字就出来了。
这样一来,打字机变成了印刷机。一次能印一整版。
以前是串行,现在是并行。
以前生成 256 个 token,模型要一个一个计算 256 次。现在几轮迭代就搞定,GPU 终于不用空转了。而且因为 256 个 token 同时存在,每个 token 都能看到其他所有 token,形成了「双向注意力」。这是自回归模型做不到的。它生成第 50 个 token 的时候,第 51 到第 256 个还不存在。
「双向注意力」带来了一个实打实的好处。
你给它一段代码,中间挖掉一块,让它填。自回归模型只能从左到右一个一个猜。DiffusionGemma 能同时看到前后上下文,直接填进去。
代码补全、行内编辑、数学公式、结构化数据,这些「非线性」任务,天然适合扩散模型。

Unsloth 团队用 DiffusionGemma 微调了一个数独求解器。自回归模型解数独很吃力,因为每个数字都依赖后面还没生成的数字。扩散模型直接统筹全局,一次填完。
DiffusionGemma 速度极快。H100 上能达到 1107 tok/s,RTX 5090 700+ tok/s。
但,智商打了折扣。

MMLU Pro 研究生级知识测试,DiffusionGemma 77.6%,标准 Gemma 4 82.6%。
AIME 2026 数学推理,69.1% vs 88.3%。差了将近 20 个百分点。
LiveCodeBench v6 竞赛编程,69.1% vs 77.1%。
GPQA Diamond 科学推理,73.2% vs 82.3%。
每项都低那么一点。谷歌自己也说,这是实验性模型。需要最高质量输出的场景,还是用标准 Gemma 4。

「用速度换智商。将近 4 倍速度,八成智商。」
这笔账划不划算,取决于你用它来做什么。
实时交互、代码补全、快速迭代,1107 tok/s 的速度优势是碾压级的。
写论文、解竞赛题、做复杂推理,标准模型仍然更靠谱。
DiffusionGemma 的底座和 Gemma 4 26B 一样,总参数 26B,混合专家(Mixture of Experts,MoE)架构,推理时只激活 3.8B 参数。
量化之后占用大约 18GB 显存。
RTX 5090 32GB 没问题。RTX 4090 24GB 也装得下。
谷歌和英伟达一起做了优化,支持 NVFP4(4 位浮点)加速,消费级显卡就能跑起来。英伟达的 DGX Spark 桌面工作站也能跑到每秒 150 个 token,DGX Station 直接拉到 2000 tok/s。
Hugging Face 已经可以下载。Unsloth 发布了 GGUF 量化版本。vLLM、MLX、Hugging Face Transformers 全部支持。
DiffusionGemma 抱抱脸下载地址:https://huggingface.co/google/diffusiongemma-26B-A4B-it
谷歌的 Gemma 4 家族今年已经发布了五款模型。从手机端的 E2B 到桌面端的 31B,再到上周的无编码器 12B。
DiffusionGemma 是第六位成员,也是画风最不一样的一个。
前面五个拼的是智商。这个主打一个速度。
我是木易,Top2 + 美国 Top10 CS 硕,现在是 AI 产品经理。
关注「AI信息Gap」,让 AI 成为你的外挂。
[

💬 本文评论区已开启,但暂无读者留言。
本文转载自微信公众号,如有侵权请联系删除。
- 标题: 1107 token/s!刚刚,谷歌开源 DiffusionGemma,本地大模型速度起飞
- 作者: lxiol
- 创建于 : 2026-06-15 19:20:55
- 更新于 : 2026-06-30 17:05:34
- 链接: https://blog.lxiol.cn/2026/06/15/1107-tokens刚刚谷歌开源-DiffusionGemma本地大模型速度起飞/
- 版权声明: 本文章采用 CC BY-NC-SA 4.0 进行许可。