GitHub · 版本发布

transformers v5.11.0

transformers v5.11.0

二〇二六年八月二十六日 · 英文原文

Hugging Face Transformers 发布 v5.11.0,新增 DiffusionGemma 和 DeepSeek-V3.2 模型。DiffusionGemma 采用编码器-解码器架构与多画布采样实现块自回归文本生成,提升推理速度。DeepSeek-V3.2-Exp 由 DeepSeek-AI 推出,引入 DeepSeek Sparse Attention(DSA)稀疏注意力机制,基于 685B 参数 MoE 主干网络,结合可扩展强化学习在竞赛数学和编程 benchmark 上达到金牌级别。KernelConfig API 扩展支持 n 对 1 模块融合与参数变换,并修复 NemotronH/Zamba2 的 Mamba2 CUDA 内核 dtype 不匹配问题。并行化方面修复 Qwen2-VL、Qwen2.5-VL 和 Qwen3-VL MoE 模型的束搜索错误。

发布 v5.11.0

新增模型

DiffusionGemma

DiffusionGemma 旨在通过采用专门针对推理速度优化的编码器-解码器架构,减少标准因果语言模型的顺序瓶颈。在推理过程中,DiffusionGemma 利用多画布采样(multi-canvas sampling),即模型不是一次生成一个 token,而是使用扩散采样器(diffusion sampler)迭代地对一整块 token 进行去噪。与传统的顺序生成方法相比,这种块自回归(block-autoregressive)方法能够以更快的速度进行文本生成。

链接: 文档

DeepSeek-V3.2

DeepSeek-V3.2-Exp 是 DeepSeek-AI 推出的实验性模型,引入了 DeepSeek Sparse Attention(DSA),这是一种可训练的、细粒度的稀疏注意力机制,旨在提高长上下文场景下的训练和推理效率。该模型基于 DeepSeek-V3.1-Terminus 构建,采用 685B 参数的 Mixture-of-Experts 主干网络,通过仅关注过去 token 的一个选定子集,降低了长序列上的二次注意力计算成本,同时保持了几乎相同的 benchmark 性能。该工作在 DeepSeek-V3.2 中得到扩展,将 DSA 与可扩展的强化学习相结合,在竞赛数学和竞争性编程 benchmark 上达到了金牌级别的结果。

链接: 文档 | 论文

内核

KernelConfig API 已扩展以支持 n 对 1 模块融合和参数变换,简化了自定义内核与 Transformers 模块的集成方式。其他修复包括:解决了 NemotronH/Zamba2 的 Mamba2 CUDA 内核路径中的 dtype 不匹配问题,增加了细粒度的 fp8/fp4 Triton 内核支持,并修正了 FalconMamba 快速路径警告,推荐使用 pip install kernels 而不是 mamba-ssm

并行化

修复了 Qwen2-VL、Qwen2.5-VL 和 Qwen3-VL MoE 模型系列中的模型并行束搜索(beam search)错误,并增加了关于连续批处理(continuous batching)的张量并行(tensor parallelism)支持的文档。

[余略,详见 https://github.com/huggingface/transformers/releases/tag/v5.11.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日