论文
ReLibra:用于强化学习中 MoE 训练的路由重放引导负载平衡
ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning
摘要
负载不平衡是混合专家 (MoE) 训练中长期存在的挑战,并且在 LLM 的强化学习 (RL) 中加剧,其中热门专家可能会在微批次之间频繁更换。现有的教育部训练系统依靠历史负荷来预测未来的专家需求,这使得它们在剧烈波动下效率降低。我们提出了 ReLibra,这是一种 MoE RL 训练系统,它利用 RL 的采样轨迹训练工作流程(路由重播)中的独特机会,以实现微批次粒度的细粒度负载平衡。由于采样轨迹和训练使用相同的 MoE 参数处理相同的词元,因此在训练开始之前就知道词元到专家的路由决策。利用这些信息,ReLibra 在批间和批内时间尺度上放置了两个 MoE 负载平衡机制,将其通信模式与分层网络带宽相匹配。在批次间时间尺度上,ReLibra进行专家重新排序,重新分配专家以实现批次级跨节点平衡;在批内时间尺度上,它在节点内动态执行专家复制以吸收微批级别的负载波动。对不同 MoE LLM 和 RL 工作负载的实验表明,即使在给 EPLB 提供预言机负载时,ReLibra 也能比 Megatron-LM 提高高达 1.6$\times$ 的训练吞吐量,比 EPLB 提高高达 1.2$\times$ 的训练吞吐量。此外,ReLibra 的吞吐量仍保持在理想平衡基线的 6%-10% 以内。