MiniMax-M3-MXFP8
MiniMax-M3-MXFP8
摘要
MiniMax发布M3原生多模态模型,拥有约428B参数和约23B激活参数,支持1M上下文。该模型从训练初期即进行文本、图像和视频的混合模态训练,并引入MiniMax Sparse Attention(MSA)以提升长上下文效率。在1M上下文下,M3相比M2实现9倍prefill加速和15倍decode加速,每token计算量降至1/20。M3在长周期agentic benchmark上达到前沿水平,同时提供MXFP8量化版本MiniMax-M3-MXFP8。
MiniMax-M3 是一个原生多模态模型,支持 1M 上下文。它拥有约 428B 参数和约 23B 激活参数。
亮点:
- 原生多模态: M3 从第一步起就进行混合模态训练,实现了文本、图像和视频之间更深层的语义融合。
- 通过稀疏注意力扩展上下文: M3 引入了 MiniMax Sparse Attention (MSA) 以提升长上下文效率。在 1M 上下文下,M3 相比 M2 实现了 9 倍的 prefill 加速和 15 倍的 decode 加速,将每 token 计算量降至 1/20。
- 编码与协作能力: M3 在长周期 agentic benchmark 上达到了前沿水平,在编码和协作两方面均表现出色。
MiniMax-M3-MXFP8 是 MiniMax-M3 的 MXFP8 量化版本,后者是一个支持 1M 上下文的原生多模态模型。它拥有约 428B 参数和约 23B 激活参数。
MiniMax Sparse Attention (MSA)
M3 由 MiniMax Sparse Attention (MSA) 驱动,这是一个专为百万 token 上下文设计的高性能稀疏注意力算子。与 GQA 相比,MSA 在保持模型质量的同时,显著降低了注意力计算量和内存占用。
📄 阅读技术报告:arXiv:2606.13392 · Hugging Face Papers
如何使用
M3 支持两种推理模式:
- thinking — 适用于复杂推理、agentic 任务和长周期协作。
- non-thinking — 适用于对延迟敏感的场景,如聊天和代码补全。
本地部署
下载模型:
hf download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3
我们推荐使用以下推理框架(按字母顺序排列)来服务该模型:
SGLang - 参见 SGLang cookbook。
vLLM - 参见 vLLM recipes。
推理参数
我们推荐以下参数以获得最佳性能:temperature=1.0,top_p=0.95,top_k=40。
联系我们
通过 model@minimax.io 联系我们。
译自 MiniMax · HF · 录于 二〇二六年八月二十六日