DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs

发布于

IT之家 7 月 22 日消息,英伟达昨日(7 月 21 日)发布博文,宣布其 Blackwell GB300 刷新 MoE 预训练的世界纪录,**每 GPU 算力达 1648 TFLOPs(每秒万亿次浮点运算)。**

IT之家注:MoE(混合专家模型)是一种机器学习模型架构。它将大型模型分割为多个更小的“专家”子网络,每次推理或训练时仅激活其中一部分。该架构旨在以更低的计算成本实现更大规模的模型容量,常用于大语言模型以提升效率。

![黑威科技展示图](http://pic.zhso.org/2026/07/22/d86ad490d9d9.jpg)

模型预训练是指在大规模无标注数据集上,利用自监督学习方法让模型初步掌握通用的语言规律、视觉特征或常识。

在最新博文中,英伟达表示:
> 使用 256 块 GPU 预训练 DeepSeek-v3 671B 模型,GB300 NVL72 实现了每 GPU 吞吐 1648 TFLOPs 的全新世界纪录。在相同训练任务上,GB300 NVL72 用更少的 GPU 硬件,达到了相同的性能。

英伟达表示在过去 6 个多月时间里,通过模拟超过 25 万种不同配置,为 Blackwell 摸索发现了 38 项重大优化方案,累计进行了 140 万小时的 GPU 优化测试。

![优化过程图](http://pic.zhso.org/2026/07/22/1180ebed719c.jpg)

相比较 2025 年 11 月的预训练测试(1088 TFLOPs)结果,GB300 NVL72 系统性能优化提升 50%。

![性能对比图](http://pic.zhso.org/2026/07/22/486f3fc103a9.jpg)

与上一代 GB200 每 GPU 606 TFLOPs 的成绩相比,GB300 实现了约 3 倍的性能跃升。

![性能跃升图](http://pic.zhso.org/2026/07/22/c560df823def.jpg)

![实验室环境图](http://pic.zhso.org/2026/07/22/229b39246268.png)

![科研人员图](http://pic.zhso.org/2026/07/22/28b178973eb0.jpg)

![产品展示图](http://pic.zhso.org/2026/07/22/b83b0d24a66f.jpg)

---

原文链接:[点击查看](https://www.ithome.com/0/980/018.htm)

评论

暂无评论。