论文
一边生成一边修剪:在线采样轨迹剪枝以实现更快更好的 RLVR
Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR
摘要
具有可验证奖励的强化学习(RLVR)显着提高了 大语言模型(LLM)的推理能力。然而,诸如 GRPO 和 DAPO 之类的方法会遭受巨大的计算成本,因为它们依赖于对每个提示进行多次轨迹采样。此外,在 RLVR 中,相对优势通常很稀疏:许多样本变得几乎全部正确或全部错误,产生较低的组内奖励方差,从而产生较弱的学习信号。在本文中,我们介绍了arrol(通过在线Rollout Pruning加速RLVR),这是一种在线Rollout修剪方法,它在生成过程中修剪Rollout,同时明确引导幸存的Rollout更加正确平衡,以增强学习信号。具体来说,arrol 动态训练轻量级质量头来预测部分采样轨迹的成功概率,并使用它来做出早期修剪决策。学习到的质量头可以进一步权衡候选者,以提高测试时间缩放期间的推理准确性。为了提高效率,我们提出了一种系统设计,该设计可以修剪推理引擎内部的部署,并重新批处理剩余的部署以进行对数概率计算和策略更新。在 Qwen-3 和 LLaMA-3.2 模型 (1B-8B) 上的 GRPO 和 DAPO 中,arrol 将平均准确度提高了 +2.30 至 +2.99,同时实现了高达 1.7 倍的训练加速,并在测试时间扩展的平均准确度方面产生了高达 +8.33 的额外增益。代码可在 https://github.com/Hsu1023/ARRoL 获取。