论文
迈向更好的训练信号:优势被削减的策略优化
Towards Better Training Signal: Advantage Clipped Policy Optimization
摘要
强化学习(RL)已成为提高大语言模型(LLM)推理能力的基石,但对策略数据的需求极大地限制了训练效率。通过重要性采样(IS)重用off-policy数据可以提高效率,但会带来相当大的不稳定性。因此,PPO和GRPO等算法广泛采用IS比率裁剪来稳定训练。然而,训练稳定性和梯度估计主要由IS比率和优势的乘积决定。为了进一步稳定训练,我们提出了 ACPO,它剪裁了 IS 比率和优势的乘积,从而获得更稳定的梯度估计。我们还on-policy镜像下降(PMD)中建立了 ACPO 和梯度裁剪之间的联系,这是一种稳定优化过程的标准技术,并证明了裁剪-PMD 在标准 RL 设置下的收敛性。在广泛使用的数学推理基准上进行的实验表明,ACPO 在准确性和训练效率方面始终优于 PPO 和 GRPO,与 Qwen3-8B+PPO 相比,ACPO 比标准数学基准提高了 4-6 个百分点。因此,ACPO 是大语言模型 RL 训练后传统 IS 比率裁剪的实用且有效的替代方案。