论文

PSRA:切换推理策略,改善RLVR的有效探索

The Model Knows Another Way: Strategy Switching for Effective RLVR Exploration

模型训练强化学习RLVR

摘要

具有可验证奖励的强化学习(RLVR)通常受到探索不足的限制:困难的问题可能会产生一致错误的rollout组,因此学习信号很少。我们表明,此类失败并不一定反映出能力缺失。相反,有限抽样通常集中于特定问题的主导推理策略,而留下尚未探索的模型已经支持的替代策略。此外,这些策略的可访问性在强化学习过程中不断发展:一些策略被内化为自主行为,而另一些策略在被吸收之前变得难以引发。受这些观察的启发,我们引入了问题-策略rollout分配(PSRA),它将无指导和策略条件提示视为竞争的探索臂,并使用贝叶斯顺序分配将固定的rollout预算引导到最有可能产生信息丰富的非饱和组的臂。保护目标使有用的策略条件路径保持可访问性,同时成功的引导行为转移到非引导策略。在从 1.5B 到 7B 的 Qwen2.5 模型和两个 RL 训练语料库中,PSRA 持续提高推理性能,减少死饱和,加强分布外传输,并在推理预算增加的情况下保持更大的增益。