论文
DBLP:用于突发弹性分布式 ML 训练的相位感知有界损失传输
DBLP: Phase-Aware Bounded-Loss Transport for Burst-Resilient Distributed ML Training
摘要
随着数十亿至万亿参数规模模型的盛行,分布式机器学习(ML)训练已成为必需。虽然之前的工作从应用层的机器学习角度提高了训练效率,但通常无法解决网络层的瞬时拥塞事件,从而引入严重的尾部延迟和训练时间可变性,从而损害分布式机器学习训练系统的服务质量。现有的网络优化平等地对待所有梯度,因此无法将足够的模型训练见解集成到通信协议设计中。在本文中,我们提出了动态有界损失协议(DBLP),这是一种突发弹性、训练阶段感知且与硬件无关的传输协议,它将模型级容差属性合并到梯度通信中。通过在训练阶段动态调整梯度损失容限,DBLP 减少了总体训练时间并减轻了瞬态高损失事件(即微爆发)期间的尾部延迟崩溃。与当前最先进的解决方案(基线)相比,DBLP 在实现相当的测试精度的同时,可以承受明显更高的损失,并将端到端训练时间平均减少 24.4%,最多减少 33.9%。在微突发事件中,DBLP 的单轮通信延迟速度比基线提高了 5.88 倍,从而防止突发引起的尾部延迟峰值并保持稳定的训练性能。