GitHub · 版本发布

transformers v5.12.0

transformers v5.12.0

二〇二六年八月二十六日 · 英文原文

Hugging Face Transformers 发布 v5.12.0,新增三个模型:MiniMax-M3-VL 视觉语言模型,结合 CLIP 风格视觉塔与 3D 旋转位置编码,采用混合密集/稀疏 MoE 解码器;PP-OCRv6 轻量级 OCR 系统,基于 MetaFormer 构建块与结构重参数化,提供 medium、small、tiny 三个层级;Parakeet-RNNT 语音识别模型,由 Fast Conformer 编码器与 RNN-T 解码器组成。

发布 v5.12.0

新增模型

MiniMax-M3-VL

MiniMax-M3-VL 是 MiniMax-M3 系列中的视觉语言模型,它将 CLIP 风格的视觉塔(vision tower)与 3D 旋转位置编码(3D rotary position embeddings)相结合,并采用 MiniMax-M3 文本骨干网络。该模型使用混合密集/稀疏的专家混合(Mixture-of-Experts)解码器,配备 SwiGLU-OAI 门控专家(gated experts)和用于块稀疏注意力(block-sparse attention)的闪电索引器(lightning indexer)。模型通过 Conv3d 补丁嵌入(patch embedding)系统处理图像,并包含用于高效多模态理解和生成的专用组件。

链接: 文档

PP-OCRv6:更新文档和慢速测试 (#46576)

PP-OCRv6 的官方权重已发布:PP-OCRv6 是一个轻量级 OCR 系统,它将架构创新与以数据为中心的优化相结合。它围绕统一的 MetaFormer 风格构建块(building block)并采用结构重参数化(structural reparameterization),重新设计了骨干网络、检测颈(detection neck)和识别颈(recognition neck)。三个模型层级(medium、small、tiny)共享相同的块原语(block primitives),覆盖从服务器到边缘的部署场景。

添加 Parakeet-RNNT (#46331)

ParakeetForRNNT:一个 Fast Conformer 编码器 + 一个 RNN-T(RNN 换能器)解码器

[余略,详见 https://github.com/huggingface/transformers/releases/tag/v5.12.0]

译自 GitHub · 版本发布 · 录于 二〇二六年八月二十六日