论文
EVPO:LLM 后训练 中自适应批评利用的方差策略优化的解释
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
摘要
LLM 的强化学习(RL) 后训练 面临一个基本的设计选择:是否使用学习批评家作为策略优化的基线。经典理论倾向于基于批评的方法(例如 PPO)来减少方差,但无批评的替代方法(例如 GRPO)由于其简单性和竞争性能而获得了广泛采用。我们表明,在稀疏奖励设置中,学习批评家可以注入超过其捕获的状态信号的估计噪声,从而增加而不是减少优势方差。通过将基线选择视为卡尔曼滤波问题,我们将 PPO 和 GRPO 统一为卡尔曼增益的两个极端,并证明可从单个训练批次计算的解释方差 (EV) 可以识别准确的边界:正 EV 表示批评者减少了方差,而零或负 EV 表示批评者增加了方差。基于这一见解,我们提出了解释方差策略优化(EVPO),它在每个训练步骤中监控批次级 EV,并在基于批评者的优势估计和批次均值优势估计之间自适应切换,证明在每个步骤中都不会实现比两者中更好的方差更大的方差。在跨越经典控制、代理交互和数学推理的四个任务中,EVPO 始终优于 PPO 和 GRPO,无论哪个固定基线在给定任务上更强。进一步的分析证实,自适应门控跟踪批评家在训练中的成熟度,并且理论上得出的零阈值在经验上是最佳的。