论文
PR2通过预测专家选择的变化改善MoE强化学习稳定性
PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning
摘要
MoE在生成训练样本和计算训练梯度时,可能选择不同专家,造成概率估计不一致。路由重放通过保存并重用专家选择缓解问题,但在同一批样本经历多次更新后,旧选择可能不再适合新的模型状态。 PR2训练轻量预测器估计路由的短期变化,在生成阶段选择预计适合更新后模型的专家,训练阶段固定这些专家编号并使用当前参数计算梯度。论文在Qwen3-30B-A3B、Moonlight-16B-A3B和OLMoE上比较训练曲线、概率比率和推理表现。研究增加的是预测更新后的选择,而不是首次提出路由重放。
