论文

推理展开中的学习:面向高效强化学习的渐进式Rollout分配

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)已成为提升 LLM 推理能力的高效框架,GRPO 等方法是其最成功的实例之一。然而,GRPO 依赖对长思维链 rollout 的重复生成。训练时间随 rollout 数量扩展,而其中很大一部分是无信息量的。因此,GRPO 计算代价高且不稳定。为缓解这一问题,现有方法要么生成更大的 rollout 池并过滤出最有信息量的提示,要么在训练后期利用历史信号进行过滤。这些策略带来有限的性能提升,却拖慢了整体流程。为解决这一问题,我们提出 VIGOR(VarIance Guided Online Rollout allocation):不再为每个样本分配固定的 rollout 预算,而是先对批内所有样本进行少量 rollout,然后迭代地向组奖励方差最高的样本追加分配 rollout,直至达到固定的总 rollout 预算。理论上,我们证明在 RLVR 下奖励方差控制梯度幅值,并推导出 VIGOR 相对 GRPO 的闭式加速比,在帕累托分布的奖励方差下该加速比随精化轮数增长。在数学推理与编程任务上的实验表明,VIGOR 在数学上以最多减少 2.3$ imes$ 的 rollout 达到目标准确率,以减少 1.49$ imes$ 的 rollout 达到 GRPO 的最终编程完全通过率,并将编程平均测试通过率提升 3.4 个百分点。

推理展开中的学习:面向高效强化学习的渐进式Rollout分配:论文配图
图 3:VIGOR 概述。该方法执行迭代推出生成和基于方差的提示选择,逐步将推出预算重新分配给信息更丰富的提示,同时保持底层 GRPO 更新管道不变。