用高级融合内核提升 MoE 训练吞吐量
Boosting MoE Training Throughput with Advanced Fusion Kernels
摘要
混合专家(MoE)模型已成为大规模AI系统的基础组件,通过每个token仅激活部分参数实现更大模型容量,在有限计算预算内提供性能扩展方法。该技术被广泛采用,支持模型规模持续增长。
混合专家(Mixture-of-Experts,MoE)模型已迅速成为现代大规模AI系统的基础组件。它们被广泛采用,是因为能够在每个token仅激活部分参数的前提下实现显著更大的模型容量,从而在实用计算预算内提供一种无与伦比的性能扩展方法。随着模型规模持续增长……来源
译自 NVIDIA · Developer 博客 · 录于 二〇二六年六月十五日