论文

SparseRL-Sync:无损权重同步,通信量减少约 100 倍

SparseRL-Sync: Lossless Weight Synchronization with ~100x Less Communication

AI 基础设施分布式训练基础设施

摘要

在具有解耦的Trainer-Rollout执行的大规模强化学习(RL)系统中,Trainer必须定期将策略权重同步到Rollout端以限制策略过时。当节点间带宽充足时,这种同步通常仅占端到端成本的一小部分。然而,随着模型尺寸的增大,通信需求迅速增加。在带宽受限或网络可变的部署中(例如,跨数据中心或跨集群设置、异构资源池和在线强化学习),权重同步可能成为吞吐量和尾部延迟的主要瓶颈。我们观察到,在主流的大模型 RL 训练中,参数实际变化的位置在元素级别上非常稀疏(通常稀疏度为 99% 以上)。基于这一观察,我们提出并实现了 SparseRL-Sync,它用可以在推理端精确重建的无损稀疏更新负载(索引和值)取代全权重传输,从而保持 100% 的保真度。在简化的成本模型下,稀疏同步将每次更新的通信量从 S 减少到大约 S/X;稀疏度为 99% (X ~ 100) 时,传输数据量将减少约 100 倍。与适当的分桶相结合,SparseRL-Sync 还可以减少启动和控制平面开销,从而显着提高带宽有限和高度异步 RL 设置中的可扩展性和端到端效率。