7月21日,英伟达宣布Blackwell架构GB300 NVL72系统在MoE模型预训练中实现每GPU 1648 TFLOPs算力,创世界纪录。该系统仅用256块GPU即完成DeepSeek-v3 671B模型训练,较GB200提升约3倍,较2025年11月测试结果提升50%。优化基于6个多月、超25万种配置的模拟及140万小时GPU测试。MoE架构通过动态激活子网络提升大模型训练效率。