英伟达近日宣布,其Blackwell GB300在MoE(混合专家模型)预训练领域创造了新的世界纪录,每GPU算力高达1648 TFLOPs(每秒万亿次浮点运算)。这一突破标志着英伟达在高性能计算领域再次迈出重要一步,为大规模语言模型的训练提供了更强大的硬件支持。
MoE是一种先进的机器学习模型架构,通过将大型模型分割为多个更小的“专家”子网络,每次推理或训练时仅激活其中一部分,从而在降低计算成本的同时实现更大规模的模型容量。这种架构在大语言模型中尤为常见,能够显著提升训练和推理效率。
在最新测试中,英伟达使用256块GPU预训练DeepSeek-v3 671B模型,GB300 NVL72系统展现了卓越的性能。与以往相比,该系统在相同训练任务下用更少的硬件达到了相同的性能水平,进一步证明了其高效性。英伟达透露,这一成果得益于过去6个多月时间里对超过25万种不同配置的模拟测试,最终发现了38项重大优化方案,累计进行了140万小时的GPU优化测试。
与2025年11月的预训练测试结果(1088 TFLOPs)相比,GB300 NVL72系统的性能优化提升了50%。与上一代GB200每GPU 606 TFLOPs的成绩相比,GB300实现了约3倍的性能跃升,标志着英伟达在GPU技术上的又一次重大突破。