论文

PAIR:RLVR 中自适应轨迹采样分配的成对感知包含重新加权

PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR) 花费大部分计算来生成长推理轨迹组。最近的分配者通过根据难度或效用的逐点概念将预算分配给提示、轨迹采样或词元来降低成本。我们发现了统计不匹配:未裁剪的留一组相对分数梯度不是独立点贡献的总和,而是成对轨迹采样的二阶 U 统计量。因此,完成一次轨迹采样揭示了与其他所有已完成的轨迹采样的对比,并且自适应端点选择改变了可观察的对项。我们引入了 PAIR(成对感知包含重新加权),它将短的 rollout 前缀视为顶点,将成对梯度项视为对比图的边。仅前缀预测器估计正确性和剩余词元成本;凸设计在预期后缀 -词元预算 下选择正连续概率;并且由完整顶点引起的每条边都通过其记录的联合包含概率进行反加权。在条件独立的 同策略 轨迹采样和未裁剪、非标准化目标下,生成的估计器对于完整的候选对梯度是无设计偏差的。在 Qwen3-1.7B/4B 上运行的计算匹配 RLVR 中,PAIR 比最强的逐点分配器将平均准确度提高了 +1.2 和 +1.4,同时使用的生成词元比全组 GRPO 少了 51% 和 52%。冻结群体估计器审核证实,未加权的自适应选择是有偏差的,而成对包含校正则以匹配的后缀成本恢复了完整的成对目标。