论文

采样轨迹通过率控制:引导二元奖励 RL 走向信息最丰富的机制

Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime

模型训练强化学习

摘要

软件工程的代理强化学习(RL)将大部分计算花费在状态轨迹上,其分组的二元奖励高度倾斜且对比度弱。我们将其框架为通过率控制,并表明在四个标准下,二元奖励侧信号在 50% 的采样轨迹通过率附近最强:奖励熵、组过滤生存、组相对策略优化 (GRPO) 下的留一法 (RLOO) 优势能量以及成功-失败对计数。我们提出前缀采样(PS),它重放自生成的轨迹前缀,以引导倾斜的群体走向这种制度:成功的前缀为大多数失败的群体提供了一个良好的开端,而失败的前缀则让大多数通过的群体陷入困境。重放的状态通过现有的采样轨迹路径重建,并且重放的词元被屏蔽以免受损失,因此优化仅适用于当前策略的延续。在 SWE-bench Verified 上,PS 在评估变异性内达到了基线高分状态,同时在 Qwen3-14B 和 Qwen3-32B 上提供了 2.01 倍和 1.55 倍的端到端挂钟加速; 14B 峰值从 0.274 提高到 0.295。 AIME 2025 对 4B 和 8B 的实验显示了相同的通过率控制模式,并且 4B 消融将增益归因于重放、双向覆盖和自适应控制。