论文
回收失败:通过细粒度离策略引导挽救RLVR中的探索
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
摘要
基于可验证奖励的强化学习(RLVR)已成为增强大型推理模型复杂推理能力的有力范式。然而,标准的结果导向监督存在一个关键局限:它把那些大体正确但因若干失误而失败的轨迹,与完全错误的轨迹同样重度惩罚。这种粗糙的反馈信号使模型丢弃有价值的大体正确rollout,导致rollout多样性退化,过早收窄探索空间。过程奖励模型(Process Reward Model)已证明能为测试时扩展提供可靠的逐步验证,但把这些信号作为稠密奖励直接集成进RLVR被证明无效。此前方法尝试引入离策略引导的整条轨迹替换,其往往超出策略模型的分布,但仍未利用模型自身生成的大体正确rollout,因此未能有效缓解探索空间的收窄。为解决这些问题,我们提出SCOPE(Step-wise Correction for On-Policy Exploration),一个利用过程奖励模型定位次优rollout中首个错误步骤并施加细粒度、逐步离策略纠正的新框架。通过对部分正确的rollout施加精确修正,我们的方法有效挽救部分正确的轨迹,把多样性分数提升13.5%,从而维持宽广的探索空间。大量实验表明,我们的方法建立了新的最先进结果,数学推理平均准确率达46.6%,并在分布外推理任务上以53.4%的准确率展现稳健泛化。
