GitHub · 版本发布

transformers v5.14.0

transformers v5.14.0

二〇二六年八月二十六日 · 英文原文

Hugging Face Transformers 发布 v5.14.0,新增 Thinking Machines 的 Inkling 模型(总计 975B/活跃 41B),支持文本、图像、音频输入及文本输出,面向 agent、RAG 等场景;新增 TIPSv2 及 TIPSv2 DPT 模型。破坏性变更包括 GPTNeoX 的 `embed_out` 重映射至 `lm_head`、GPTBigCode 启用 `_supports_attention_backend = True` 以兼容 vLLM。内核方面,SDPA prefill 利用 FlashAttention 与 StaticCache,大输入尺寸速度提升达 260%。生成方面新增多 token 预测(MTP)解码支持及静态集成验证。

发布 v5.14.0

新增模型

Inkling(来自 Thinking Machines):总计 975B,活跃 41B

Inkling 是一个通用多模态模型,接受文本、图像和音频输入,并生成文本输出。它适用于英语及其他语言,以及多种编程语言。该模型专为构建 AI 驱动的应用程序的开发者设计,包括 agentic 和工具使用系统、编程助手、聊天机器人以及检索增强生成(RAG)系统,并适用于通用对话、指令遵循及其他自然语言和多模态任务。它以开放权重发布,以支持下游开发者进行研究、微调及集成到第三方产品中。

TIPSv2

链接: 文档

TIPSv2 DPT

链接: 文档

:rotating_light: 破坏性变更

GPTNeoX 现在将 embed_out 重新映射到 lm_head,GPTBigCode 已启用 _supports_attention_backend = True 以兼容 vLLM;依赖这些模型先前权重命名或 attention 后端行为的用户应相应更新其代码。

内核

进行了多项与内核相关的修复和改进,包括在 benchmark 工作流中将 kernels 依赖固定到兼容版本、从 LocalLayerRepository 中移除已弃用的 package_name 参数,以及使 DeepGEMM Triton 回退在 CUDA_HOME 未设置或配置错误时更加稳健。此外,SDPA prefill 已更新为利用 FlashAttention 内核与 StaticCache,从而带来显著的性能提升(对于大输入尺寸,速度提升高达 260%)。

生成

生成方面的改进包括添加多 token 预测(MTP)解码支持、用于推测解码的静态集成验证以提高 draft token 接受率,以及修复使用不同 tokenizer 时贪婪辅助解码的崩溃问题。还修正了连续批处理模式下关于 synced_gpus 的误导性双重否定警告消息。

[余略,详见 https://github.com/huggingface/transformers/releases/tag/v5.14.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日