在NVIDIA GB300 NVL72上创下MoE预训练世界纪录
Setting a World Record for MoE Pre-Training on NVIDIA GB300 NVL72
摘要
NVIDIA GB300 NVL72在预训练DeepSeek-V3 671B模型时,以每GPU 1,648 TFLOPs的性能创下世界纪录。该成果展示了混合专家(MoE)架构下,通信效率成为大规模AI训练的关键瓶颈,而GB300 NVL72通过优化通信瓶颈,显著提升了模型在数千块GPU上的扩展效率。
前沿模型预训练已收敛于混合专家(MoE)架构,这从根本上改变了大规模AI训练的瓶颈所在。随着每token计算量的下降,通信越来越成为决定模型在数千块GPU上扩展效率的关键因素。NVIDIA GB300 NVL72 以每GPU 1,648 TFLOPs的性能,在预训练DeepSeek-V3 671B模型时创下了世界纪录,展示了整个AI领域的技术进步如何…… 来源
译自 NVIDIA · Developer 博客 · 录于 二〇二六年七月二十一日