论文
通过蒙特卡洛 Pass@k Critic 以单条采样轨迹学习
Learning with a Single Rollout via Monte Carlo Pass@k Critic
摘要
评估 词元级 在语言模型强化学习 (RL) 方面的优势仍然具有挑战性,因为扩大情景经验收集的成本很高。基线优势估计方法的难度加大,其中重复采样导致轨迹分化为截然不同的推理前缀。在这种情况下,GRPO 等 RL 算法被证明是有限的:结果奖励太稀疏,无法归因于中间步骤等特定操作,而且采样轨迹之间的比较也很重要,因为它们是异构的。为了减轻重复采样的计算成本和贡献分配的难度,我们研究了在语言模型的强化学习中采用 词元级 贡献分配的单条采样轨迹近端策略优化 (SR-PPO)。我们没有通过标准化候选组内的偶发回报来估计优势,而是使用每次提示的一次采样轨迹的蒙特卡罗结果来训练一个经过校准的 词元级 贡献评估模型。具体来说,我们使用价值模型来预测提示前缀处的 Pass@k 成功概率,该概率源自 Pass@1 尝试。这种选择会产生比 Pass@1 更具选择性的学习信号:它会折扣容易解决的前缀,同时优先考虑成功概率仍然很小的困难前缀。我们表明,随着 $k$ 的增加,Pass@k 收敛到一个可达性指标,反映一个前缀是否可以导致至少一个成功的延续。在显式状态图中,可以在 $O(|V|+|E|)$ 时间内计算极限 ($k \rightarrow \infty$),为直接贡献分配提供有希望的替代,而无需对对比轨迹进行采样。作为初步验证,SR-PPO 表现出稳定的学习动态,以及在 HMMT26 和 AIME24 等数学推理基准上 Pass@128 成功率的持续增长。