论文
超越 同策略 探索:在扩散语言模型中集成强化学习的外部策略轨迹
Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models
摘要
最近的扩散 大语言模型 (dLLM) 强化学习方法通常依赖于目标 dLLM 本身生成的 同策略 采样轨迹。然而,当成功的同策略轨迹很少时,同策略 训练可能不会获得什么积极的回报,并且只能取得有限的进展。为了缓解这个问题,我们探索将更强有力的外部策略产生的更高奖励的采样轨迹与目标 dLLM 的 同策略 采样轨迹结合起来。然而,直接合并这些外部采样轨迹会带来两个实际挑战:采样轨迹长度的差异以及联合处理来自 同策略 和外部采样轨迹的奖励时的不稳定性。为了应对这些挑战,我们提出了带有长度控制和源特定处理的外部采样轨迹集成(ERILS),它控制外部采样轨迹长度并分别处理 同策略 和外部采样轨迹的奖励。零样本评估下数独、倒计时和 MATH500 的实验表明,ERILS 提高了所有三个任务的多样本性能,其中数独的收益最大。在数独上,ERILS 实现了 98.4% 的 4 中最佳完成精度,而最强基线的精度为 40.3%。 ERILS 还在数独上在 128、256 和 512 个词元的生成长度上保持大约 90% 的确定性单次完成精度。我们的组件分析进一步表明,长度控制的外部采样轨迹比不受控制的外部采样轨迹更有效,并且特定源的奖励处理避免了联合奖励处理中观察到的训练崩溃。这些结果表明,将外部采样轨迹集成到 dLLM 强化学习中时,采样轨迹构建和奖励处理是重要的设计维度。