论文

AutoLoCo:通过自适应同步减少大语言模型分布式训练通信

AutoLoCo: Communication Efficient Distributed LLM Training via Adaptive Synchronization

AI 基础设施分布式训练基础设施

摘要

大语言模型 (LLM) 的预训练越来越多地在多个数据中心进行。随着训练扩展到更多数量的加速器,花在计算上的时间会减少,而花在通信上的时间会增加。因此,频繁的同步成为越来越大的瓶颈。本地更新方法允许工作人员在同步之间执行多个优化器步骤,从而降低了成本。大多数本地更新方法在训练之前设置同步之间的本地优化器步骤数,并在整个运行过程中保持此间隔固定。然而,最佳间隔在整个训练过程中可能会发生变化。如果间隔和优化器适应当前训练状态,则在保持训练性能的同时降低通信频率。在这项工作中,我们引入了 AutoLoCo,一种自适应训练框架,用于减少 LLM 训练中的通信。它使用标量训练统计数据来调整本地间隔并纠正每个外部更新。我们的方法受到两个观察的启发:1)适当的局部间隔在不同的训练阶段有所不同,2)改变每个间隔的内部步骤数会导致与未更改的外部优化器不匹配,需要对外部更新进行修正。我们通过使用累积的内部学习率校正动量和学习率的外部优化器来优化这种不匹配。我们在通信限制下的实验表明,在保持训练性能的同时,AutoLoCo 相对于 DiLoCo 降低了 27% 的通信频率。