DeepMind · 官方

DiffusionGemma:文本生成速度提升4倍

DiffusionGemma: 4x faster text generation

二〇二六年六月十日 · 英文原文

Google DeepMind 于2026年6月10日发布DiffusionGemma,一款基于Apache 2.0许可证的26B参数混合专家(MoE)实验性开放模型。该模型采用文本扩散方法,通过同时生成256 token的文本块,在单块NVIDIA H100上实现每秒超1000 token、在RTX 5090上超700 token的推理速度,较传统自回归LLM提升高达4倍。推理时仅激活3.8B参数,量化后可适配18GB VRAM的消费级GPU。模型支持双向注意力和迭代自我修正,适用于行内编辑、代码填充等速度关键型本地工作流,但整体输出质量低于标准Gemma 4。

2026年6月10日

5分钟阅读

我们最新的开放实验模型在专用 GPU 上实现了高达 4 倍的推理速度提升,为探索速度关键型、交互式本地工作流打开了大门。

B

Brendan O'Donoghue

研究科学家

S

Sebastian Flennerhag

研究科学家

Image 1: DiffusionGemma

收听文章 此内容由 Google AI 生成。生成式 AI 处于实验阶段

[[duration]] 分钟

今天,我们推出 DiffusionGemma,这是一款实验性开放模型,探索了文本扩散(text diffusion)——一种极快的文本生成方法。该模型基于 Apache 2.0 许可证发布,是一个 26B 参数的混合专家(MoE)模型,它超越了典型自回归大语言模型(LLM)逐 token 顺序处理的模式。相反,它同时生成整个文本块,在 GPU 上实现高达 4 倍的文本生成速度。

DiffusionGemma 基于我们 Gemma 4 系列业界领先的每参数智能水平以及前沿的 Gemini Diffusion 研究,集成了一个专为最大化生成速度而设计的新型扩散头(diffusion head)。虽然自回归的 Gemma 4 模型仍是高质量生产输出的标准,但 DiffusionGemma 专为探索速度关键型、交互式本地工作流的研究人员和开发者设计,例如行内编辑、快速迭代以及生成非线性文本结构。

为开发者解锁新价值

构建实时交互式 AI 应用的开发者常常面临本地推理的延迟瓶颈。DiffusionGemma 直接应对这些挑战,并带来一些关键权衡:

你可以通过微调来提升 DiffusionGemma 在特定任务上的性能。在下面的示例中,Unsloth 微调了 DiffusionGemma 来玩数独——这是一项自回归模型难以处理的任务,因为每个 token 都依赖于后续 token。DiffusionGemma 的双向注意力使这变得容易得多。

微调后的 DiffusionGemma 解决数独问题。

为什么对文本采用扩散方法?

尽管 AI 研究社区探索基于扩散的文本生成已有多年,但将其应用于大型模型仍然是一个挑战。DiffusionGemma 通过改变模型使用硬件的方式改变了这一点。

传统模型的权衡

大多数语言模型像打字机一样工作,从左到右一次生成一个 token。在云端,这很高效,因为服务器可以将数千个用户请求批量处理,共享硬件负载。但在本地为单个用户运行时,这种逐词处理过程会使你的专用 GPU 或 TPU 利用率不足——它大部分时间只是在等待下一次"按键"。

DiffusionGemma 逆转了这种低效。它不是顺序预测单词,而是同时起草整个 256 token 的段落。通过一次性给计算机处理器分配更大的工作块,DiffusionGemma 充分利用了你的硬件潜力。它将模型推理从一台顺序工作的打字机升级为一台巨大的印刷机,同时印出整个文本块。

DiffusionGemma 文本转 3D SVG 演示(由 Hugging Face 提供)。逐步生成过程。

这意味着 DiffusionGemma 的速度提升是为本地和低并发推理设计的。在高 QPS 的云端服务中,自回归模型可以高效部署以饱和计算资源,因此 DiffusionGemma 的并行解码带来的收益递减,并可能导致更高的服务成本。在单加速器上的低到中等批量大小下,吞吐量优势最为明显。

文本扩散的工作原理

类似于 AI 图像生成器从视觉静态开始并迭代优化为清晰图像,DiffusionGemma 将其应用于文本:

  1. 画布: 模型从一个由随机占位 token 组成的画布开始。
  2. 迭代优化: 模型进行多次传递,锁定正确的 token,并将其作为上下文线索来优化其余部分。
  3. 最终润色: 文本收敛为高质量输出。

由于模型在生成过程中可以处理整个段落,它解锁了新的模型行为模式,例如完美闭合复杂的 markdown 格式,或近乎实时地生成和渲染代码。

立即开始

译自 DeepMind · 官方 · 录于 二〇二六年六月十日