MiniMax-M3
MiniMax-M3
MiniMax 发布原生多模态模型 MiniMax-M3,拥有约 428B 总参数和约 23B 激活参数,支持 100 万 token 上下文。模型从训练初期即采用混合模态训练,实现文本、图像和视频的语义融合。其引入 MiniMax Sparse Attention(MSA)稀疏注意力机制,与 M2 相比在百万 token 上下文下 prefill 速度提升 9 倍、decode 速度提升 15 倍,单 token 计算量降至 1/20。M3 在长程 agentic benchmark 上达到前沿水平,支持 thinking 和 non-thinking 两种推理模式,可通过 MiniMax Agent、API 及 SGLang、vLLM、Transformers 等框架部署。
MiniMax-M3 是一个原生多模态模型,支持 100 万 token 上下文。它拥有约 428B 参数和约 23B 激活参数。
亮点:
- 原生多模态: M3 从训练第一步起就采用混合模态训练,实现了文本、图像和视频之间更深层的语义融合。
- 通过稀疏注意力扩展上下文: M3 引入了 MiniMax Sparse Attention (MSA) 来提升长上下文效率。与 M2 相比,在 100 万 token 上下文下,M3 的 prefill 速度提升了 9 倍,decode 速度提升了 15 倍,每个 token 的计算量降至 1/20。
- 编码与协作能力: M3 在长程 agentic benchmark 上达到了前沿水平,在编码和协作方面均表现出色。
MiniMax Sparse Attention (MSA)
M3 由 MiniMax Sparse Attention (MSA) 驱动,这是一个专为百万 token 上下文设计的高性能稀疏注意力算子。与 GQA 相比,MSA 在保持模型质量的同时,大幅降低了注意力计算量和内存占用。
📄 阅读技术报告:arXiv:2606.13392 · Hugging Face Papers
如何使用
M3 支持两种推理模式:
- thinking — 适用于复杂推理、agentic 任务和长程协作。
- non-thinking — 适用于对延迟敏感的场景,如聊天和代码补全。
本地部署
下载模型:
hf download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3
我们推荐以下推理框架(按字母顺序排列)来运行模型:
SGLang — 参见 SGLang cookbook。
vLLM — 参见 vLLM recipes。
Transformers — 参见 Transformers 文档。
推理参数
我们推荐以下参数以获得最佳性能:temperature=1.0,top_p=0.95,top_k=40。
联系我们
请通过 model@minimax.io 联系我们。