论文
二元奖励 GRPO 中的梯度饥饿:为什么组均值中心化失败以及为什么最简单的修复有效
Gradient Starvation in Binary-Reward GRPO: Why Group-Mean Centering Fails and Why the Simplest Fix Works
摘要
组相对策略优化(GRPO)是一种根据可验证奖励进行强化学习的标准算法,但其以组均值为中心的优势在二元奖励下可能会失效。失败模式是梯度饥饿:当组中的每个响应都正确或每个响应都错误时,中心优势恰好为零,并且策略不会收到学习信号。我们证明真实的简并率总是超过 i.i.d.根据 Jensen 不等式进行伯努利预测,并在记录的 Qwen3.5-9B GSM8K 训练中观察到组大小为 4 的简并率为 0.69。然后,我们证明固定参考符号优势 $A=2r-1$ 通过增加组中至少一个样本成功的概率来执行 pass@$G$ 失败下降。在涵盖 7 个种子的完整 GSM8K 测试集上,Sign 的准确率达到 73.8%,而组规模为 4 时标准归一化组均值 DrGRPO 的准确率为 28.4%,提高了 45.4 点,$p<0.0001$。该效果在 Llama-3.1-8B 上方向一致,并且在 MATH-500 传输检查上为正但动力不足。 Pass@$k$ 分析表明,主要好处是搜索压缩而不是大容量扩展,使经验收益与最近的 RLVR 上限观察结果保持一致。