MiniMax · HF

MiniMax-M3

MiniMax-M3

二〇二六年八月二十六日 · 英文原文

MiniMax 发布原生多模态模型 MiniMax-M3,拥有约 428B 总参数和约 23B 激活参数,支持 100 万 token 上下文。模型从训练初期即采用混合模态训练,实现文本、图像和视频的语义融合。其引入 MiniMax Sparse Attention(MSA)稀疏注意力机制,与 M2 相比在百万 token 上下文下 prefill 速度提升 9 倍、decode 速度提升 15 倍,单 token 计算量降至 1/20。M3 在长程 agentic benchmark 上达到前沿水平,支持 thinking 和 non-thinking 两种推理模式,可通过 MiniMax Agent、API 及 SGLang、vLLM、Transformers 等框架部署。

MiniMax-M3 是一个原生多模态模型,支持 100 万 token 上下文。它拥有约 428B 参数和约 23B 激活参数。

亮点:

MiniMax Sparse Attention (MSA)

M3 由 MiniMax Sparse Attention (MSA) 驱动,这是一个专为百万 token 上下文设计的高性能稀疏注意力算子。与 GQA 相比,MSA 在保持模型质量的同时,大幅降低了注意力计算量和内存占用。

📄 阅读技术报告:arXiv:2606.13392 · Hugging Face Papers

如何使用

M3 支持两种推理模式:

本地部署

下载模型:

hf download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3

我们推荐以下推理框架(按字母顺序排列)来运行模型:

推理参数

我们推荐以下参数以获得最佳性能:temperature=1.0top_p=0.95top_k=40

联系我们

请通过 model@minimax.io 联系我们。

译自 MiniMax · HF · 录于 二〇二六年八月二十六日