论文

模型合并可以改善 DiLoCo 中的聚合吗?

Can Model Merging Improve Aggregation in DiLoCo?

模型优化模型合并

摘要

模型合并技术将独立微调的模型聚合为一个模型以结合其功能,近年来已成为一个备受关注的话题,人们提出了一系列广泛的方法来解决这一问题。同时,分布式学习的一个新兴趋势是使用本地 SGD 和 DiLoCo 等方法,通过定期聚合独立训练的本地模型来大大降低通信成本。然而,随着独立局部模型数量的增加以及全局通信之前局部训练步骤数量的增加,这些高效通信方法相对于 FLOP 匹配的数据并行标准参考来说性能会下降。在这项工作中,我们在本地 SGD/DiLoCo 中的伪梯度聚合步骤和基于任务算术的模型合并之间进行了明确的类比,建立了一种在分布式优化背景下利用合并方法的直接方法。然后,我们在此环境中评估多种最先进的模型合并方法,并确定一种特别的方法,即 Iso-C,作为改进 DiLoCo 的一种有前途的方法。我们发现,尽管本身缺乏动量机制,但采用 Iso-C 聚合的 DiLoCo SGD 不仅优于简单的伪梯度平均,甚至优于基于动量的 DiLoCo。基于这一发现,我们提出了 IsoLoCo,它通过为 Iso-C 配备 Nesterov 动量来适应分布式训练。我们对不同数量的本地工人的语言模型 预训练 进行的实证评估表明,IsoLoCo 显着优于 DiLoCo,并且随着工人数量的增加,它们之间的差距越来越大。这种优势在模型大小和内部步数方面仍然存在,证实了合并启发的聚合是低通信分布式训练的有效策略。