论文

ReCo:根据分布集中度重新调整 GRPO 的权重

ReCo: Reweighting GRPO Against Distributional Concentration

模型训练强化学习

摘要

组相对策略优化(GRPO)已成为 后训练 语言模型的标准强化学习方法。最近的研究表明,当 k 很大时,GRPO 会降低基础模型的推理能力,并且在 Pass@k 中表现不佳,这表明推理路径的覆盖范围减少。我们发现这种减少与 GRPO 集中于基础模型已经以高概率生成的响应有关。我们将这种集中追溯到 GRPO 更新中的两个机制。在响应级别,高概率响应通过重复出现主导群体梯度。在 词元级 处,GRPO 的重要性比例呈梯度变化,进一步强化了在当前政策下更有可能出现的词元。我们提出了 ReCo,一种解决这两种影响的重新加权方法。响应贡献根据其在采样轨迹组中的预期发生进行标准化,并且 词元级 重要性比率被基于方差的比率所取代,该比率为非饱和决策点提供更大的更新规模,其中替代词元选择仍然合理。在 Qwen2.5-Math-1.5B/7B 和 Llama-3.1-8B-Instruct 的五个数学推理基准测试中,ReCo 改进了大 k 值的 Pass@k,并且与小 k 值的 GRPO 相当。