论文
组自适应裁剪策略优化
Group Adaptive Clipping Policy Optimization
摘要
具有可验证奖励的强化学习 (RLVR) 的组相对策略优化通常使用固定的重要性采样 (IS) 比率来修剪所有部署的边界。我们发现了一个关键的限制:尽管贡献了非常不同的学习信号,但在较难的问题上很少有正确的采样轨迹,而在较简单的问题上的大量正确的采样轨迹却以相当的速度被削减。群体成功率较低的采样轨迹表现出更大的 IS 比率,并为探索和解决新问题带来更强的梯度信号,但受到固定裁剪的不成比例的抑制。为了解决这个问题,我们提出了组自适应裁剪策略优化(GAPO),这是对 GRPO 方法的插件修改,可以使裁剪边界适应采样轨迹优势。 GAPO 的动机是反向 KL 信任域视角,这表明具有较大学习信号的采样轨迹应该按比例获得更大的更新空间。 GAPO 不需要奖励塑造,并保留标准 PPO/GSPO 替代项,同时仅调整裁剪阈值。在 Qwen 和 Llama 模型中,GAPO 在数学推理和编码基准的固定裁剪和优势塑造基线上持续改进了 Pass@1 和 Pass@k,其中基础模型的通过率相对较低。