论文

关于带有结果奖励的无偏且长度不变的策略优化的不可能性

On the Impossibility of Unbiased and Length-Invariant Policy Optimization with Outcome Rewards

模型训练强化学习

摘要

组相对策略优化 (GRPO) 是 大语言模型 中训练推理能力的主要强化学习算法,尤其被 DeepSeek-R1 采用。最近的改进 GRPO 博士(COLM 2025)识别了 GRPO 中每轨迹长度归一化引起的响应级别长度偏差,并建议删除这种归一化,声称生成的优化器是“无偏的”。我们证明这一主张是不完整的。具体来说,我们建立一个不可能定理:在标准结果奖励+GRPO设置下,没有一个基于长度的加权方案可以同时实现以下两个属性。 (P1) 梯度无偏性:梯度估计器是对真实策略梯度的无偏估计。 (P2) 长度不变性:每个轨迹对梯度的有效贡献与其标记长度无关。 GRPO近似满足P2但违反P1; GRPO博士满足P1但违反P2。我们通过参数族 f_alpha(L) = L^{alpha - 1} 来表征完整的权衡谱,其中 alpha = 0 恢复 GRPO,alpha = 1 恢复 Dr. GRPO,并提供定量分析,表明 Dr. GRPO 的长度偏差可以导致更长的轨迹通过与长度比成比例的因子来主导梯度更新。我们的结果表明,这两种算法都不是普遍“正确执行”的。它们处于基本且不可避免的权衡的相反两端。