论文
重新思考 PPO 中的批判性学习:理解和缓解价值扁平化
Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening
摘要
在大型语言模型的强化学习中,近端策略优化(PPO)通常使用批评家来估计状态值并减少策略更新的方差。然而,我们发现了 PPO 批评家的系统性故障模式,我们称之为价值扁平化:根据多个蒙特卡罗延续估计的状态值在中间状态之间急剧变化,而批评家的预测仍然相对平坦。我们在受控的 FrozenLake 环境中进一步观察这种现象,发现随着状态空间的增长,这种现象变得更加明显。我们的理论和实证分析将值扁平化与批评者损失中的隐式方差惩罚以及来自具有相似梯度的时间相关状态的冗余更新联系起来。受这些发现的启发,我们引入了 SParse 近端策略优化 (SP$^3$O),它将价值损失仅应用于每个响应中的几个分离良好的状态,以减轻这两种影响。 Qwen3-Base 上的实验表明,每个响应仅监督三个状态的 SP$^3$O 可以减轻价值扁平化,并持续改进跨模型大小和评估套件的学习策略。总之,我们的结果将价值扁平化确定为标准 PPO 中批判性学习的一种重要但被忽视的失败模式,并表明简单的稀疏监督策略可以缓解它。