论文
CommFuse:通过分布式 LLM 训练的通信分解和融合隐藏尾部延迟
CommFuse: Hiding Tail Latency via Communication Decomposition and Fusion for Distributed LLM Training
摘要
大语言模型 规模的快速增长需要在 GPU、TPU 和 NPU 等加速器之间划分计算工作负载。然而,这些并行化策略会产生大量的数据通信开销,从而严重阻碍计算效率。虽然通信-计算重叠提供了一个有前途的方向,但现有的基于数据切片的解决方案却存在尾部延迟。为了克服这一限制,本研究引入了一种新颖的通信计算重叠技术,以消除分布式 LLM 训练的最先进重叠方法中的尾部延迟。该技术的目的是有效缓解分布式训练和推理的张量并行和数据并行的通信瓶颈。特别是,我们提出了一种名为 CommFuse 的新颖方法,它用分解的点对点(P2P)通信取代了传统的减少分散和全收集的集体操作,并调度分区计算以实现细粒度的重叠。我们的方法提供了一种精确的算法来减少通信开销,从而消除尾部延迟。此外,它还提供了与数据并行训练和各种张量级并行策略(包括 TPSP 和 UP)兼容的多功能解决方案。实验评估表明,我们的技术始终能够实现更低的延迟、卓越的模型 FLOPS 利用率 (MFU) 和高吞吐量。