论文
具有可验证奖励的强化学习的多步似然比校正
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
摘要
具有可验证奖励的强化学习(RLVR)对于提高 大语言模型 的推理能力起着关键作用。然而,广泛使用的 PPO 替代目标从根本上来说是局部的,因为它们依赖于精确策略梯度目标的局部近似。虽然这种近似通过减少重要性采样引起的方差来提高稳定性,但它也在代理目标中引入了结构偏差,必须通过信任域机制来控制结构偏差。在这项工作中,我们引入了 $N$ 步前向追踪,它使用下一个 $N-1$ 标记的累积似然比来增强 PPO 代理目标。基于这个想法,我们提出了$N$步前向跟踪策略优化(NFPO),这是一种实用的RLVR算法,它将$N$步前向跟踪集成到屏蔽策略梯度框架中。 NFPO 在 PPO 替代目标和确切的政策梯度目标之间架起了一座连续的桥梁,为控制偏差-方差权衡提供了原则性机制。我们的理论分析表明,通过适当选择 $N$,所提议的目标会产生比标准 PPO 替代项更严格的政策改进界限。综合推理基准实验表明 NFPO 持续提高性能,支持了我们的理论发现。