论文

用于弹性分布式的解耦 DiLoCo 预训练

Decoupled DiLoCo for Resilient Distributed Pre-training

AI 基础设施分布式训练基础设施

摘要

现代大规模语言模型 预训练 严重依赖于单程序多数据 (SPMD) 范式,这需要加速器之间的紧密耦合。由于这种耦合,瞬时速度减慢、硬件故障和同步开销会导致整个计算停滞,从而大规模浪费大量计算时间。虽然 DiLoCo 等最近的分布式方法减少了通信带宽,但它们基本上保持同步,并且容易受到这些系统停顿的影响。为了解决这个问题,我们引入了 De Coupled DiLoCo,这是 DiLoCo 框架的演变,旨在打破锁步同步障碍并超越 SPMD 以最大化训练吞吐量。解耦的 DiLoCo 分区跨多个执行本地内部优化步骤的独立“学习器”进行计算。这些学习器将参数片段异步传送到中央同步器,中央同步器通过使用最小仲裁、自适应宽限窗口和动态词元加权合并来聚合更新,从而避免失败或落后的学习器。受“混沌工程”的启发,我们利用数百万个模拟芯片,实现了在易发生故障的环境中显着提高训练效率,并且全局停机时间严格为零,同时在文本和视觉任务中保持具有竞争力的模型性能,无论是密集架构还是专家混合架构。