论文

PR2通过预测专家选择的变化改善MoE强化学习稳定性

PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

模型训练模型架构MoE偏好优化强化学习RLVR

摘要

MoE在生成训练样本和计算训练梯度时,可能选择不同专家,造成概率估计不一致。路由重放通过保存并重用专家选择缓解问题,但在同一批样本经历多次更新后,旧选择可能不再适合新的模型状态。 PR2训练轻量预测器估计路由的短期变化,在生成阶段选择预计适合更新后模型的专家,训练阶段固定这些专家编号并使用当前参数计算梯度。论文在Qwen3-30B-A3B、Moonlight-16B-A3B和OLMoE上比较训练曲线、概率比率和推理表现。研究增加的是预测更新后的选择,而不是首次提出路由重放。

PR2预测路由变化、记录选择并在训练时重放的流程。
Figure 1 : Overview of Predictive Routing Replay ( Pr 2 ). Routing replay stabilizes MoE RL by fixing routes, but cached routes become stale after a few off-policy steps. Pr 2 adds an evolution predictor before top- k k selection, caches the predicted expert indices during rollout, and replays them during training to preserve route consistency while tracking short-horizon router evolution.