论文

平衡聚合:理解并修复 GRPO 中的聚合偏差

Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为 大语言模型 中改进推理和代码生成的核心范式,GRPO 式训练因其简单性和有效性而被广泛采用。然而,一个重要的设计选择仍未得到充分探索:词元级 策略梯度项如何在每个采样组内聚合。标准 GRPO 使用序列聚合,而最近的工作主张将词元聚合作为更好的替代方案。我们证明这两个规则会产生不同的优化偏差:词元聚合引入了符号长度耦合,而序列聚合通过序列级相等加权隐式地降低了较长响应的权重。为了解决这种紧张关系,我们提出了 \textbf{Balanced Aggregation (BA)},这是一种简单的直接替换,可以在正子集和负子集中分别计算 词元级 均值,然后将它们与基于序列计数的权重相结合。在 DAPO-17k 和 Polaris 上使用 Qwen2.5-Math-7B 和 Qwen3-1.7B 进行的实验,在六个推理和编码基准上进行评估,表明 BA 相对于标准词元和序列聚合持续提高了训练稳定性和最终性能。我们的分析进一步表明,标记和序列聚合的相对有效性在很大程度上取决于响应长度变化和正负长度差距,强调聚合是 GRPO 式 RLVR 中的关键设计维度。