论文
用于带宽高效上下文并行训练的子空间混合
Mixtures of Subspaces for Bandwidth Efficient Context Parallel Training
摘要
具有扩展上下文窗口的预训练语言模型增强了它们在生成过程中利用丰富信息的能力。现有的方法将输入序列分割成块,在多个设备上广播它们,并逐块计算注意力,这会产生大量的通信开销。虽然这些方法在高速集群中可行,但对于低带宽连接上的分散训练来说是不切实际的。我们提出了一种在去中心化设置中实现通信高效上下文并行的压缩方法,实现了超过 95% 的显着压缩率,并且开销可以忽略不计,并且没有收敛损失。我们的主要见解是通过有效的重新参数化将激活输出动态限制为学习的子空间混合,从而利用激活输出的内在低秩结构。我们演示了将数十亿参数的去中心化模型扩展到慢至 300Mbps 的网络上超过 100K 词元的上下文长度,与 100Gbps 互连上的集中式模型的挂钟收敛速度相匹配。