论文
通过分散式 GPU 网格进行高效通信的 LLM 适应
Communication-Efficient LLM Adaptation over Decentralized GPU Meshes
摘要
去中心化训练可以通过低端 GPU 和互联网级连接进行大型模型训练,但沿数据并行和管道并行轴的通信成为主要瓶颈。我们在这种情况下研究训练前适应。我们提出了一种异步双电路系统:快速压缩训练电路使用管道并行(PP)传输和压缩数据并行(DP)同步的激活屏蔽来驱动吞吐量,而慢速锚定电路偶尔运行未屏蔽的前向-后向传递关键路径。然后,我们引入了一个频谱校正优化器,它使用这些延迟锚先验来对屏蔽梯度进行去噪,而不会阻塞快速流。尽管之前的工作发现积极的激活压缩不可靠,但我们表明,当以这种方式锚定时,掩蔽支持高压缩率下的预训练后适应。仅管道并行压缩就可带来高达 9\times$ 的吞吐量增益,将其与数据并行压缩相结合,可在互联网级 $\sim 200$Mbps 连接上增加超过 40\times$ 的吞吐量,同时在域适应和持续预训练方面匹配密集的未压缩性能。