论文
EasyPPO:稳定Critic是关键
EasyPPO: Stabilizing the Critic Is Key
摘要
近端策略优化(PPO)的一个关键优势是它的学习Critic,它使用强化学习期间收集的历史轨迹来估计预期回报并减少策略梯度方差。然而,我们发现Critic也是大语言模型(LLM)强化学习不稳定的主要来源。我们确定了两种破坏 PPO 稳定性的关键故障模式。首先,过滤来自Actor和Critic的截断rollout,将政策目标转变为以完成为条件的奖励,即使条件奖励改善,也允许截断增加。其次,异质回报噪声可能会导致高方差提示在有限批次中主导Critic更新。我们引入 EasyPPO 来解决这些故障。仅Actor的超长过滤可以训练Critic从已完成和截断的rollout中获得的回报。噪声归一化Critic回归通过其采样回报的标准差倒数对每个提示的Critic损失进行加权,从而平衡提示之间的噪声贡献。适度较小的Critic小批量将异常值的影响限制在梯度裁剪期间较少的rollout。在 FrontierCS 上的连续奖励编码、AIME24 上的二元奖励数学推理以及 Search-R1 上的多轮搜索中,EasyPPO 在整个训练范围内保持稳定,并且始终优于普通 PPO、VAPO 和 HL-Gauss PPO。其最佳验证分数比 PPO 分别提高了 14.89%、2.28% 和 9.47%。