论文

ExpDis:分离RLVR探索与学生策略优化

Decoupling Exploration from Optimization in RLVR

模型训练模型优化强化学习奖励建模与过程监督蒸馏

摘要

现代语言模型在已经训练的检查点之上进行具有可验证奖励(RLVR)的强化学习。 RLVR 的一个关键承诺是发现新的推理策略。原则上,模型可以采样先前训练数据中缺少的新想法。然而,在实践中,通过强烈的新颖性激励来增强 RLVR 的成功有限,并且可能会降低模型质量。由于可验证的奖励仅监督模型知识和行为的一小部分,因此这种退化很难恢复。相反,我们在一个称为探索蒸馏(ExpDis)的框架中将探索与优化分离。我们训练一个或多个探索者策略,并在奖励中提供新颖的奖励,过滤其轨迹的正确性和质量,并将它们提炼成单独的学生策略。然后在没有新奇奖励的情况下训练学生策略。我们将上述过程重复几轮,在探索和优化之间交替。这种脱钩使我们能够在不降低学生策略的情况下积极扩展探索。穿过 七个数学推理基准和两个模型系列,ExpDis 在相同的实际运行时间预算下优于 DAPO。此外,我们观察到 pass@$k$ 缩放的改进,表明 ExpDis 生成的模型可以生成更多样化的正确解决方案。