论文

更早判断,更省预算:面向高效 RLVR 的序贯自适应轨迹分配

Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)受到轨迹生成成本的限制,但许多采样提示产生的回答组全部正确或全部错误,奖励方差为零,无法提供策略梯度信号。现有方法要么对更大的候选池过度采样,再丢弃饱和提示,付出额外采样成本;要么在采样前预测提示难度,但策略变化会影响预测可靠性。研究发现,只需最初几次采样,往往就能判断一个回答组是否有效,因此为已经确定无效的提示完成整组采样会浪费预算。论文将每一步的轨迹收集视为预算受限的序贯分配与最优停止问题,提出序贯自适应轨迹分配方法 SARA。该方法为每个提示的成功率维护 Beta 后验,用闭式预测器评估回答组的有效性,并采用类似序贯概率比检验的双阈值规则:保留有效组,短暂探测后停止对饱和组的采样,将节省的预算分配给新提示,无需额外用于预测的轨迹。论文证明了停止采样判断的可靠性、预期采样节省、固定预算下的有效组产出优势,以及有效组产出与 GRPO 梯度范数的联系。在单 GPU、1.5B/3B 模型的数学推理与规划实验中,SARA 的效果与 DPS 相当,二者均低于 DS oracle,而 SARA 比 DS 少用 22% 的轨迹。SARA 与 DPS 结合后取得最佳准确率,略高于 DS,同时轨迹数量减少 67%,比较采用近似一致的单次采样成本。