论文

关于 Max@K 策略梯度的优势估计

On Advantage Estimates for Max@K Policy Gradients

模型训练强化学习

摘要

具有可验证奖励的强化学习广泛用于 后训练 推理模型,但稀疏的结果奖励使探索变得困难。一种补充方法是直接优化推理时间目标,例如 pass@K 和 max@K,但这些目标的现有策略梯度估计器使用不同的信号、基线和标准化,使得它们的关系不清楚。我们通过基线设计和优势集中来研究这个问题。从该领域领先方法的优势估计器开始,我们证明它是政策梯度无偏的,但产生非中心优势。然后,我们引入了留二法基线,该基线保留了策略梯度的无偏性,同时使实现的批量优势精确居中。由此产生的方法 MaxPO 具有高效的二次时间实现,并自然地集成到 LLM 后训练 的基于组的 RL 中。我们进一步推导了 max@K 的典型有限批量优势,为现有优势估计器提供了统一的视图。根据经验,我们验证了 L2O 基线减少了梯度方差并且优于非中心替代方案。