英伟达Blackwell GB300再突破:MoE预训练达1648 TFLOPs 性能跃升

   时间:2026-07-22 23:10 来源:快讯作者:江紫萱

英伟达在最新发布的博文中宣布,其Blackwell架构的GB300 GPU在混合专家模型(MoE)预训练领域创造了新的世界纪录,单GPU算力达到1648 TFLOPs(每秒万亿次浮点运算)。这一突破标志着英伟达在高效能计算领域再次取得重大进展,为大规模语言模型的训练提供了更强大的硬件支持。

MoE是一种创新的机器学习架构,通过将大型模型拆分为多个小型“专家”子网络,仅在需要时激活部分子网络进行推理或训练。这种设计显著降低了计算成本,同时保持了模型的规模和性能,尤其适用于大语言模型的开发。英伟达此次利用256块GB300 GPU预训练了6710亿参数的DeepSeek-v3模型,展示了其硬件在处理超大规模模型时的卓越效率。

与上一代GB200 GPU每秒606 TFLOPs的性能相比,GB300实现了近3倍的算力提升。这一飞跃得益于英伟达在过去六个月中进行的超过25万种配置模拟和140万小时的优化测试。通过这些努力,团队为Blackwell架构开发了38项关键优化方案,显著提升了系统在复杂任务中的表现。

在性能对比方面,GB300 NVL72系统相较于2025年11月的测试结果(1088 TFLOPs)提升了50%。这一进步不仅减少了完成相同训练任务所需的GPU数量,还降低了整体能耗和成本,为科研机构和企业提供了更具竞争力的解决方案。英伟达表示,将继续推动硬件与算法的协同创新,以满足人工智能领域日益增长的计算需求。

 
 
更多>同类内容
全站最新
热门内容