论文

RLVR 稳定性和获胜者优势策略优化的梯度视角

A Gradient Perspective on RLVR Stability and Winner Advantage Policy Optimization

模型训练强化学习RLVR

摘要

带有可验证奖励的强化学习 (RLVR) 改进了语言模型推理,但 GRPO 式的优化仍然容易崩溃。我们通过 词元级 梯度动力学分析这种不稳定性,得出预测更新如何影响下一个词元概率和熵的分类法。分类法表明,稳定性共同取决于当前政策下的优势正负号和词元分配。受这一发现的启发,我们提出了获胜者优势政策优化(WAPO),这是一个简单的在线修剪策略梯度目标,仅在积极优势完成时更新。在数学推理和多跳 QA 基准测试中,WAPO 提高了训练稳定性,并匹配或优于多个模型系列的基线。完整代码可以在 https://github.com/layer6ai-labs/wapo 找到。