解耦的 DiLoCo:分布式、弹性 AI 训练的新前沿

发布于

# 解耦的 DiLoCo:分布式、弹性 AI 训练的新前沿

Arthur Douillard 和 DiLoCo 团队

## 简介

我们最新的分布式架构帮助在远程数据中心训练大型语言模型,具有更低的带宽需求和更强的硬件弹性。传统的前沿 AI 模型训练依赖于一个大型的、紧密耦合的系统,要求相同的芯片几乎完美同步。然而,随着我们向未来更大规模的模型迈进,在数千个芯片之间保持这种同步是一个巨大的后勤挑战。

今天,我们高兴地发布了一篇新论文,介绍了一种名为解耦 DiLoCo(分布式低通信)的新方法。通过将大型训练任务划分到解耦的计算“岛屿”上,数据在这些岛屿之间异步流动,这种架构可以隔离局部干扰,使系统其他部分仍能有效学习。

这种方法提供了一种更具弹性和灵活性的方式,在全球分布的数据中心中训练高级模型。值得注意的是,解耦的 DiLoCo 不会受到之前的分布式方法(如数据并行)在全球规模上的通信延迟问题的影响。

## 开发更具故障容忍能力的异步训练

解耦的 DiLoCo 构建于两个之前的技术进展之上:[Pathways](https://blog.google/innovation-and-ai/products/introducing-pathways-next-generation-ai-architecture/),引入了基于异步数据流的分布式 AI 系统,以及[DiLoCo](https://arxiv.org/abs/2311.08105),显著减少了在分布式数据中心之间所需的带宽,使得远程大型语言模型的训练成为可能。

解耦的 DiLoCo 将这些概念结合起来,更灵活地在大规模下训练 AI 模型。它基于 Pathways 构建,使得异步训练在独立的计算岛屿(称为学习单元)之间进行,这样某个区域的芯片故障不会干扰其他区域的进展。

这种基础设施也是自愈的。在测试中,我们采用了一种称为“混沌工程”的方法,在训练过程中引入了人为的硬件故障。解耦的 DiLoCo 在损失整个学习单元后继续训练过程,并在它们恢复在线后无缝地重新集成。

## 性能测试与结果

通过使用 Gemma 4 模型测试解耦的 DiLoCo,我们发现,当硬件发生故障时,该系统的学习集群可用性比传统训练方法高得多,同时在机器学习(ML)性能的基准测试水平上也表现相同。

![性能比较图表](http://pic.zhso.org/2026/07/07/61ba6918e2c9.jpg)

## 变革 AI 训练基础设施的未来

我们在 Google 采取了一种全栈方法来进行 AI 训练,涵盖硬件、软件基础设施和研究。解耦的 DiLoCo 是一个例证,通过在互联网规模的带宽下使训练工作能够利用任何空闲计算资源,变得更为高效。

此外,这种训练范式还解锁了在单次训练中混合不同硬件代的能力,比如 TPU v6e 和 TPU v5p。这种方法不仅延长了现有硬件的有效使用寿命,还增加了可用于模型训练的总计算能力。在我们的实验中,不同代的芯片在不同速度下运行仍然达到了与单一芯片类型的训练相当的 ML 性能,确保较旧的硬件也能有效加速 AI 训练。

我们在推动 AI 基础设施的先进性时,持续探索所需的弹性系统,以解锁下一代 AI 的潜力。

[阅读我们的技术报告](https://arxiv.org/abs/2604.21428v1)

## 致谢

这项工作是由 Google DeepMind 和 Google Research 的团队成员共同完成的。解耦 DiLoCo 的主要贡献者包括 Arthur Douillard、Keith Rush、Yani Donchev、Zachary Charles、Ayush Dubey 等。我们也感谢 Jeff Dean、Marc’Aurelio Ranzato 等的支持和指导。

---

原文链接:[点击查看](https://deepmind.google/blog/decoupled-diloco/)

评论

暂无评论。