transformers v5.15.0
transformers v5.15.0
Hugging Face Transformers 发布 v5.15.0。新增 Meta Muse Glimmer(30B 参数多模态模型,含 2B ViT 视觉编码器,Apache 2.0 许可)、GraniteMoeSWA/GraniteSWA、SKT 的 A.X-K1/A.X-K2 及 Cosmos3 Edge 模型支持。破坏性变更包括:线性注意力模型 kernels 改为可选启用、缓存裁剪 API 仅接受负值、T5 家族默认支持 SDPA、移除 processor 私有辅助函数。
发布 v5.15.0
新增模型
Meta Muse Glimmer
Muse Glimmer 于今日发布,是 Meta 推出的全新多模态模型,专为 agentic 用例设计。该模型从 Muse 蒸馏至 30B 参数,并以 Apache 2.0 许可证发布,可部署到本地环境,适用于注重隐私的应用场景,如编码、文档分析、个人助理,以及类似 Claw 或 Hermes 的配置。
Muse Glimmer 是一个稠密的 30B 参数模型,包含:
- 用于视觉的 2B ViT 风格编码器(Perception Encoder)
- 28B 参数文本解码器
我们已在以下博客文章中进行了介绍:http://hf.co/blog/muse-glimmer
GraniteMoeSWA 与 GraniteSWA
链接: 文档
- 添加 Granite-swa 和 Granitemoe-swa 模型支持 (#47179),作者 @daviswer,见 #47179
链接: 文档
- 添加 Granite-swa 和 Granitemoe-swa 模型支持 (#47179),作者 @daviswer,见 #47179
A.X-K1 与 A.X-K2
链接: 文档
- 添加来自 SKT 的 AXK2 (#47528),作者 @vasqu,见 #47528
链接: 文档
- 添加 axk1 (#46867),作者 @kmswin1,见 #46867
Cosmos3 Edge
链接: 文档
- 添加 Cosmos3 Edge 模型支持 (#47181),作者 @atharvajoshi10,见 #47181
破坏性变更
线性注意力模型(Mamba、GDN、仅卷积等)的 kernels 现在改为可选启用,而非强制使用。依赖自动 kernel 选择的用户必须显式启用 kernels 以保持原有行为。
- 🚨 [
Kernels] 重构所有线性注意力模型及原生 kernels 回退 (#47630),作者 @vasqu
缓存裁剪 API 现在仅接受负值(相对偏移),不再接受绝对尺寸。直接调用裁剪方法的用户必须更新代码,传入相应的负值。
- 🚨 [cache] 裁剪只能使用负值 (#47720),作者 @Cyrilvallez
T5 及其模型家族(MT5、LongT5 等)现在通过 ALL_ATTENTION_FUNCTIONS 支持 SDPA 及其他 attention 后端。这意味着默认的 attention 实现可能发生变化,依赖此前仅 eager 路径的用户如有需要应显式设置 attn_implementation="eager"。
- 🚨 为 T5 启用 SDPA(及其他 attention 后端)并推广至 T5 家族 (#47014),作者 @jiqing-feng
多模态 processor 文件中移除了一些小型私有辅助函数(如 _is_url、_build_image_tokens)。直接导入这些私有函数的下游库或用户必须移除或替换相关引用。
- :rotating_light: Processors 更新其余部分 (#46556),作者 @zucchini-nlp
[余略,详见 https://github.com/huggingface/transformers/releases/tag/v5.15.0]