论文
贝尔曼策略优化
Bellman Policy Optimization
摘要
具有可验证奖励的强化学习(RLVR)提高了大型语言模型(LLM)的推理能力。我们引入贝尔曼策略优化(BPO),这是一种源自策略镜像下降(PMD)的无批评方法。对于具有终端奖励的自回归生成,BPO 使用贝尔曼方程将 PMD 重新表述为轨迹级目标。重新表述避免了估计中间状态的状态值。我们证明它具有与原始 PMD 目标相同的唯一最优解。我们通过近似这一目标来得出实际的 BPO 损失。其失配校正权重是互补标记概率的平滑比率。数学推理基准实验证明了 BPO 的有效性。