DiffusionGemma:文本生成速度提升4倍
DiffusionGemma: 4x faster text generation
Google DeepMind 于2026年6月10日发布DiffusionGemma,一款基于Apache 2.0许可证的26B参数混合专家(MoE)实验性开放模型。该模型采用文本扩散方法,通过同时生成256 token的文本块,在单块NVIDIA H100上实现每秒超1000 token、在RTX 5090上超700 token的推理速度,较传统自回归LLM提升高达4倍。推理时仅激活3.8B参数,量化后可适配18GB VRAM的消费级GPU。模型支持双向注意力和迭代自我修正,适用于行内编辑、代码填充等速度关键型本地工作流,但整体输出质量低于标准Gemma 4。
2026年6月10日
5分钟阅读
我们最新的开放实验模型在专用 GPU 上实现了高达 4 倍的推理速度提升,为探索速度关键型、交互式本地工作流打开了大门。
B
Brendan O'Donoghue
研究科学家
S
Sebastian Flennerhag
研究科学家

收听文章 此内容由 Google AI 生成。生成式 AI 处于实验阶段
[[duration]] 分钟
今天,我们推出 DiffusionGemma,这是一款实验性开放模型,探索了文本扩散(text diffusion)——一种极快的文本生成方法。该模型基于 Apache 2.0 许可证发布,是一个 26B 参数的混合专家(MoE)模型,它超越了典型自回归大语言模型(LLM)逐 token 顺序处理的模式。相反,它同时生成整个文本块,在 GPU 上实现高达 4 倍的文本生成速度。
DiffusionGemma 基于我们 Gemma 4 系列业界领先的每参数智能水平以及前沿的 Gemini Diffusion 研究,集成了一个专为最大化生成速度而设计的新型扩散头(diffusion head)。虽然自回归的 Gemma 4 模型仍是高质量生产输出的标准,但 DiffusionGemma 专为探索速度关键型、交互式本地工作流的研究人员和开发者设计,例如行内编辑、快速迭代以及生成非线性文本结构。
为开发者解锁新价值
构建实时交互式 AI 应用的开发者常常面临本地推理的延迟瓶颈。DiffusionGemma 直接应对这些挑战,并带来一些关键权衡:
- 极速推理: 通过将解码瓶颈从内存带宽转移到计算,DiffusionGemma 在专用 GPU 上实现了高达 4 倍的 token 输出速度。(在单块 NVIDIA H100 上每秒超过 1000 个 token,在 NVIDIA GeForce RTX 5090 上每秒超过 700 个 token)。1
- 可及的硬件需求: DiffusionGemma 作为一个总参数量为 26B 的混合专家(MoE)模型,推理时仅激活 3.8B 参数,量化后可轻松适配高端消费级 GPU 的 18GB VRAM 限制。
- 双向注意力(Bi-directional attention): 每次前向传播并行生成 256 个 token,使得每个 token 都能关注到所有其他 token。这为行内编辑、代码填充、氨基酸序列或数学图等非线性领域提供了显著优势。
- 智能自我修正: 模型迭代地优化自身输出,使其能够一次性评估整个文本块,实时修正错误。
- 实验状态与生产建议: 由于优先考虑速度和并行布局生成,DiffusionGemma 的整体输出质量低于标准 Gemma 4。对于要求最高质量的应用,我们建议部署标准 Gemma 4。
你可以通过微调来提升 DiffusionGemma 在特定任务上的性能。在下面的示例中,Unsloth 微调了 DiffusionGemma 来玩数独——这是一项自回归模型难以处理的任务,因为每个 token 都依赖于后续 token。DiffusionGemma 的双向注意力使这变得容易得多。
微调后的 DiffusionGemma 解决数独问题。
为什么对文本采用扩散方法?
尽管 AI 研究社区探索基于扩散的文本生成已有多年,但将其应用于大型模型仍然是一个挑战。DiffusionGemma 通过改变模型使用硬件的方式改变了这一点。
传统模型的权衡
大多数语言模型像打字机一样工作,从左到右一次生成一个 token。在云端,这很高效,因为服务器可以将数千个用户请求批量处理,共享硬件负载。但在本地为单个用户运行时,这种逐词处理过程会使你的专用 GPU 或 TPU 利用率不足——它大部分时间只是在等待下一次"按键"。
DiffusionGemma 逆转了这种低效。它不是顺序预测单词,而是同时起草整个 256 token 的段落。通过一次性给计算机处理器分配更大的工作块,DiffusionGemma 充分利用了你的硬件潜力。它将模型推理从一台顺序工作的打字机升级为一台巨大的印刷机,同时印出整个文本块。
DiffusionGemma 文本转 3D SVG 演示(由 Hugging Face 提供)。逐步生成过程。
这意味着 DiffusionGemma 的速度提升是为本地和低并发推理设计的。在高 QPS 的云端服务中,自回归模型可以高效部署以饱和计算资源,因此 DiffusionGemma 的并行解码带来的收益递减,并可能导致更高的服务成本。在单加速器上的低到中等批量大小下,吞吐量优势最为明显。
文本扩散的工作原理
类似于 AI 图像生成器从视觉静态开始并迭代优化为清晰图像,DiffusionGemma 将其应用于文本:
- 画布: 模型从一个由随机占位 token 组成的画布开始。
- 迭代优化: 模型进行多次传递,锁定正确的 token,并将其作为上下文线索来优化其余部分。
- 最终润色: 文本收敛为高质量输出。
由于模型在生成过程中可以处理整个段落,它解锁了新的模型行为模式,例如完美闭合复杂的 markdown 格式,或近乎实时地生成和渲染代码。
立即开始
- 下载权重: 立即在 Hugging Face 上获取实验模型权重(基于宽松的 Apache 2.0 许可证发布)。
- 集成与学习: 在我们的 DiffusionGemma 开发者指南中了解更多信息。或者深入阅读 DiffusionGemma 可视化指南以理解底层机制。
- 使用你喜爱的开发工具: 使用 MLX、vLLM(由 Red Hat 支持集成)和 Hugging Face Transformers 高效地服务模型。为了快速实验,我们发布了一个使用 Hackable Diffusion 的微调教程,这是一个专为可组合性设计的模块化 JAX 工具箱。你还可以探索使用 Unsloth 和 NVIDIA NeMo 进行微调。此外,对 llama.cpp 的官方支持即将到来。
- 体验优化性能: 我们与 NVIDIA 合作,在其整个硬件堆栈上进行优化,确保与消费级设置(为 GeForce RTX 5090 和 4090 GPU 量化)的兼容性,同时在企业系统(使用高级 NVFP4 内核的 Hopper 和 Blackwell)上提供高性能,包括用于本地桌面部署的 NVIDIA DGX Spark 和 DGX Station,以及面向 AI 专业人员的 RTX PRO。对 NVFP4(4 位浮点数)的原生支持加速了计算吞吐量,使模型能够以更快的速度运行,同时保持近乎无损的精度。
- 自行尝试: 在你的桌面专用 GPU 上运行,或通过 Gemini Enterprise Agent Platform Model Garden 或 NVIDIA NIM 在云端运行。