论文

隐藏在GRPO中的虚假优势

Spurious Advantage Hidden in GRPO

模型训练强化学习RLVR

摘要

组相对策略优化(GRPO)被广泛研究用于具有可验证奖励的强化学习,其中其优势估计器根据组内奖励统计数据为每次采样轨迹分配一个大小。在常见情况下,这种程度的奖励是通过推理得出正确答案的。然而,一个被忽视的案例具有相同的表面:通过猜测,采样轨迹可能会落在它上面,并且该公式仍然分配一个高的幅度,我们将其识别为虚假优势。这在三种情况下会出现:具有小候选集的有界答案任务;托管有界子案例的开放答案集;以及预算为同一答案开辟多种路径的搜索代理。在这三者中,这都会将政策误导为类似猜测的行为。我们提出 SIGNBALANCE,其大小是无组合的:它保留验证者符号,使用全局尺度,并通过每类的停止梯度重新缩放来恢复零均值平衡。在不同规模的数学和搜索代理基准测试中,SIGNBALANCE 在开放答案数学上与 GRPO 相匹配,并改进了有界答案数学和搜索代理。代码将被发布。