论文
不依赖负样本轨迹:带有隐式负梯度的正样本策略优化
Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients
摘要
具有可验证奖励的强化学习(RLVR)由于确定性验证,成为增强大语言模型(LLM)推理能力的主导范式。社区见证了从近端策略优化(PPO)到组相对策略优化(GRPO)的快速变化,其中GRPO通过对分组正向和负向采样轨迹的简单估计来减少复杂的优势估计。然而,我们注意到,负数采样轨迹可能不承认失败严重程度的分级,并且组合的巨大性使得惩罚一些采样负数不太可能在稀疏的二元奖励下覆盖有意义的奖励信号。在这项工作中,我们提出了仅正向策略优化(POPO),这是一种新颖的 RLVR 框架,其中学习可以完全通过在线正向采样轨迹进行。具体来说,POPO 在正采样轨迹集上利用有限重要性采样。因此,不相交的负采样轨迹用于梯度引导。我们表明,通过采样轨迹重新分配来增强正概率,隐式负梯度可以自然出现。接下来,POPO通过两种机制来稳定策略优化。首先,它应用具有基于动量的适应律的连体政策网络来稳定政策演变。其次,我们用暹罗表示空间中的有界相似性惩罚项替换 KL 散度。我们使用公开可用的、完善的文本 LLM 模型(例如 Qwen 系列)在所有级别的数学基准上进行了广泛的实验。我们的实验表明,POPO 的性能与 GRPO 相当,甚至优于 GRPO。值得注意的是,我们表明 POPO 在 AIME 2025 中使用 Qwen-Math-7B 可以达到 36.67%,优于 GRPO 30.00%。我们的消融和扫描研究进一步说明了 POPO 组件的必要性和稳健性。