MiniMax · HF

MiniMax-M3-MXFP8

MiniMax-M3-MXFP8

二〇二六年八月二十六日 · 英文原文

MiniMax发布M3原生多模态模型,拥有约428B参数和约23B激活参数,支持1M上下文。该模型从训练初期即进行文本、图像和视频的混合模态训练,并引入MiniMax Sparse Attention(MSA)以提升长上下文效率。在1M上下文下,M3相比M2实现9倍prefill加速和15倍decode加速,每token计算量降至1/20。M3在长周期agentic benchmark上达到前沿水平,同时提供MXFP8量化版本MiniMax-M3-MXFP8。

MiniMax-M3 是一个原生多模态模型,支持 1M 上下文。它拥有约 428B 参数和约 23B 激活参数。

亮点:

MiniMax-M3-MXFP8 是 MiniMax-M3 的 MXFP8 量化版本,后者是一个支持 1M 上下文的原生多模态模型。它拥有约 428B 参数和约 23B 激活参数。

MiniMax Sparse Attention (MSA)

M3 由 MiniMax Sparse Attention (MSA) 驱动,这是一个专为百万 token 上下文设计的高性能稀疏注意力算子。与 GQA 相比,MSA 在保持模型质量的同时,显著降低了注意力计算量和内存占用。

📄 阅读技术报告:arXiv:2606.13392 · Hugging Face Papers

如何使用

M3 支持两种推理模式:

本地部署

下载模型:

hf download MiniMaxAI/MiniMax-M3 --local-dir MiniMax-M3

我们推荐使用以下推理框架(按字母顺序排列)来服务该模型:

推理参数

我们推荐以下参数以获得最佳性能:temperature=1.0top_p=0.95top_k=40

联系我们

通过 model@minimax.io 联系我们。

译自 MiniMax · HF · 录于 二〇二六年八月二十六日