MiniMax 稀疏注意力
MiniMax Sparse Attention
来自 MiniMax
摘要
超长上下文能力正成为前沿大语言模型(LLM)不可或缺的特性:智能体工作流、仓库级代码推理和持久记忆都需要模型共同关注数十万到数百万个token,但softmax注意力的二次方成本使得这一需求在部署规模下难以实现。我们提出MiniMax稀疏注意力(MSA),一种基于分组查询注意力(GQA)构建的块级稀疏注意力机制。轻量级索引分支对键值块进行评分,并为每个GQA组独立选择Top-k子集,在保持高效块级执行的同时实现组级稀疏检索;主分支则仅对所选块执行精确的块稀疏注意力。MSA的设计遵循简洁与可扩展原则,经过刻意精简,使其能够轻松地在各类GPU上高效部署。为将稀疏性转化为实际加速,我们与MSA协同设计了GPU执行路径,采用无指数Top-k选择和KV外部稀疏注意力,在块粒度访问下提升张量核心利用率。在原生多模态训练的109B参数模型上,MSA性能与GQA相当,同时在1M上下文长度下将每个token的注意力计算量减少28.4倍。结合协同设计的内核,MSA在H800上实现了14.2倍的预填充加速和7.6倍的解码端到端加速。我们的推理内核已开源:https://github.com/MiniMax-AI/MSA。基于MSA的生产级原生多模态模型已在Hugging Face公开发布:https://huggingface.co/MiniMaxAI/MiniMax-M3。
译自 Hugging Face · Daily Papers · arXiv:2606.13392 · 录于 二〇二六年六月十二日