transformers v5.13.0
transformers v5.13.0
Hugging Face Transformers 发布 v5.13.0,新增 Kimi K2.5/2.6/2.7、MiMo-V2-Flash 及 Nemotron 3.5 ASR 等模型。Kimi K2.5 为开源原生多模态 agentic 模型,提升长周期编码与 swarm 任务编排能力;MiMo-V2-Flash 由小米 MiMo 团队开发,为 MoE 语言模型,在 27T tokens 上训练,支持 256K 上下文窗口;Nemotron 3.5 ASR 为 NVIDIA 600M 参数多语言语音识别模型,采用缓存感知 FastConformer-RNNT 架构,支持 80ms 至 1120ms 可配置流式块大小。
发布 v5.13.0
新增模型
KimiK 2.5、2.6 和 2.7
本版本包含 Kimi 2.5 的架构,该架构被 2.5-2.7 版本使用:
Kimi K2.5 是一个开源的原生多模态 agentic 模型,在长周期编码、编码驱动设计、主动自主执行以及基于 swarm 的任务编排方面提升了实用能力。该模型在 Kimi K2.5: Visual Agentic Intelligence 中提出,并在 [Kimi K2.6: Advancing Open-Source Coding](Kimi K2.5: Visual Agentic Intelligence) 中进一步改进。
Kimi K2.5 在复杂的端到端编码任务上取得了显著提升,能够稳健地泛化到多种编程语言(Rust、Go、Python)以及前端、DevOps 和性能优化等领域。该模型能够将简单的 prompt 和视觉输入转化为可直接投入生产的界面和轻量级全栈工作流,生成结构化的布局、交互元素和丰富的动画,并具备精心的美学精度。
链接: 文档
- 新增模型:Kimi2-6 (#45630) 由 @zucchini-nlp 在 #45630 中贡献
MiMo-V2-Flash
MiMo-V2-Flash 是由小米 MiMo 团队开发的混合专家(MoE)语言模型。该模型旨在建立长上下文建模能力与推理效率之间的新平衡,专为在复杂推理和 agentic 任务中实现强劲性能而设计。MiMo-V2-Flash 在 27T tokens 上训练,原生支持 32k 序列长度,同时无缝支持扩展的 256K 上下文窗口,与标准全局 attention 模型相比,显著减少了 KV-cache 存储。
链接: 文档
- 新增小米 MiMo-V2 (#45144) 由 @casinca 在 #45144 中贡献
Nemotron 3.5 ASR
Nemotron 3.5 ASR 是 NVIDIA 推出的 600M 参数多语言语音识别模型,专为低延迟流式和高吞吐量批量场景下的高质量转录而构建,原生支持标点和大写。在流式模式下,它提供可配置的块大小——80ms、160ms、560ms 和 1120ms,让用户可以根据应用需求在延迟和准确性之间进行权衡。其缓存感知的 FastConformer-RNNT 架构是实现这一能力的关键:与传统的缓冲流式(反复重新处理重叠的音频窗口)不同,该模型仅处理每个新传入的块,同时重用来自先前块的缓存 encoder 上下文。这消除了冗余计算,显著提高了效率,并在不牺牲准确性的情况下最小化端到端延迟,使其非常适合实时转录工作负载。
链接: 文档
- 新增 Nemotron 3.5 ASR 流式 (#46565) 由 @eustlb 在 #46565 中贡献
NemotronAsrStreaming
Nemotron ASR Streaming 是 NVIDIA 推出的 600M 参数英语语音识别模型,专为低延迟流式和高吞吐量批量场景下的高质量转录而构建,原生支持标点和大写。在流式模式下,它提供可配置的块大小——80ms、160ms、560ms 和 1120ms,让用户可以根据应用需求在延迟和准确性之间进行权衡。其缓存感知的 FastConfo…
[余略,详见 https://github.com/huggingface/transformers/releases/tag/v5.13.0]