transformers v5.12.0
transformers v5.12.0
Hugging Face Transformers 发布 v5.12.0,新增三个模型:MiniMax-M3-VL 视觉语言模型,结合 CLIP 风格视觉塔与 3D 旋转位置编码,采用混合密集/稀疏 MoE 解码器;PP-OCRv6 轻量级 OCR 系统,基于 MetaFormer 构建块与结构重参数化,提供 medium、small、tiny 三个层级;Parakeet-RNNT 语音识别模型,由 Fast Conformer 编码器与 RNN-T 解码器组成。
发布 v5.12.0
新增模型
MiniMax-M3-VL
MiniMax-M3-VL 是 MiniMax-M3 系列中的视觉语言模型,它将 CLIP 风格的视觉塔(vision tower)与 3D 旋转位置编码(3D rotary position embeddings)相结合,并采用 MiniMax-M3 文本骨干网络。该模型使用混合密集/稀疏的专家混合(Mixture-of-Experts)解码器,配备 SwiGLU-OAI 门控专家(gated experts)和用于块稀疏注意力(block-sparse attention)的闪电索引器(lightning indexer)。模型通过 Conv3d 补丁嵌入(patch embedding)系统处理图像,并包含用于高效多模态理解和生成的专用组件。
链接: 文档
- 添加 minimax m3vl (#46600) 由 @ArthurZucker 在 #46600 中提交
PP-OCRv6:更新文档和慢速测试 (#46576)
PP-OCRv6 的官方权重已发布:PP-OCRv6 是一个轻量级 OCR 系统,它将架构创新与以数据为中心的优化相结合。它围绕统一的 MetaFormer 风格构建块(building block)并采用结构重参数化(structural reparameterization),重新设计了骨干网络、检测颈(detection neck)和识别颈(recognition neck)。三个模型层级(medium、small、tiny)共享相同的块原语(block primitives),覆盖从服务器到边缘的部署场景。
- PP-OCRv6:更新文档和慢速测试 (#46576) 由 @ zhang-prog 提交
添加 Parakeet-RNNT (#46331)
ParakeetForRNNT:一个 Fast Conformer 编码器 + 一个 RNN-T(RNN 换能器)解码器
- RNN-T 解码器:标准神经换能器(neural transducer):
- LSTM 预测网络(prediction network)在 token 预测之间维护语言上下文。
- 联合网络(joint network)结合编码器和解码器的输出。
- 用于推理的贪婪换能器解码(greedy transducer decoding):空白发射(blank emission)将编码器帧向前推进一帧,非空白发射(non-blank emission)则停留在同一帧。
- 添加 Parakeet-RNNT (#46331) 由 @eustlb 提交
[余略,详见 https://github.com/huggingface/transformers/releases/tag/v5.12.0]