GitHub · 版本发布

transformers v5.13.0

transformers v5.13.0

二〇二六年八月二十六日 · 英文原文

Hugging Face Transformers 发布 v5.13.0,新增 Kimi K2.5/2.6/2.7、MiMo-V2-Flash 及 Nemotron 3.5 ASR 等模型。Kimi K2.5 为开源原生多模态 agentic 模型,提升长周期编码与 swarm 任务编排能力;MiMo-V2-Flash 由小米 MiMo 团队开发,为 MoE 语言模型,在 27T tokens 上训练,支持 256K 上下文窗口;Nemotron 3.5 ASR 为 NVIDIA 600M 参数多语言语音识别模型,采用缓存感知 FastConformer-RNNT 架构,支持 80ms 至 1120ms 可配置流式块大小。

发布 v5.13.0

新增模型

KimiK 2.5、2.6 和 2.7

本版本包含 Kimi 2.5 的架构,该架构被 2.5-2.7 版本使用:

Kimi K2.5 是一个开源的原生多模态 agentic 模型,在长周期编码、编码驱动设计、主动自主执行以及基于 swarm 的任务编排方面提升了实用能力。该模型在 Kimi K2.5: Visual Agentic Intelligence 中提出,并在 [Kimi K2.6: Advancing Open-Source Coding](Kimi K2.5: Visual Agentic Intelligence) 中进一步改进。

Kimi K2.5 在复杂的端到端编码任务上取得了显著提升,能够稳健地泛化到多种编程语言(Rust、Go、Python)以及前端、DevOps 和性能优化等领域。该模型能够将简单的 prompt 和视觉输入转化为可直接投入生产的界面和轻量级全栈工作流,生成结构化的布局、交互元素和丰富的动画,并具备精心的美学精度。

链接: 文档

MiMo-V2-Flash

MiMo-V2-Flash 是由小米 MiMo 团队开发的混合专家(MoE)语言模型。该模型旨在建立长上下文建模能力与推理效率之间的新平衡,专为在复杂推理和 agentic 任务中实现强劲性能而设计。MiMo-V2-Flash 在 27T tokens 上训练,原生支持 32k 序列长度,同时无缝支持扩展的 256K 上下文窗口,与标准全局 attention 模型相比,显著减少了 KV-cache 存储。

链接: 文档

Nemotron 3.5 ASR

Nemotron 3.5 ASR 是 NVIDIA 推出的 600M 参数多语言语音识别模型,专为低延迟流式和高吞吐量批量场景下的高质量转录而构建,原生支持标点和大写。在流式模式下,它提供可配置的块大小——80ms、160ms、560ms 和 1120ms,让用户可以根据应用需求在延迟和准确性之间进行权衡。其缓存感知的 FastConformer-RNNT 架构是实现这一能力的关键:与传统的缓冲流式(反复重新处理重叠的音频窗口)不同,该模型仅处理每个新传入的块,同时重用来自先前块的缓存 encoder 上下文。这消除了冗余计算,显著提高了效率,并在不牺牲准确性的情况下最小化端到端延迟,使其非常适合实时转录工作负载。

链接: 文档

NemotronAsrStreaming

Nemotron ASR Streaming 是 NVIDIA 推出的 600M 参数英语语音识别模型,专为低延迟流式和高吞吐量批量场景下的高质量转录而构建,原生支持标点和大写。在流式模式下,它提供可配置的块大小——80ms、160ms、560ms 和 1120ms,让用户可以根据应用需求在延迟和准确性之间进行权衡。其缓存感知的 FastConfo…

[余略,详见 https://github.com/huggingface/transformers/releases/tag/v5.13.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日