论文

自我演化的单向策略优化 LLM

One-Way Policy Optimization for Self-Evolving LLMs

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为扩展 大语言模型(LLM)推理能力的有前途的范例。然而,二进制验证者奖励的稀疏性往往会导致效率低下和优化不稳定。为了稳定训练,现有方法通常施加相对于参考策略的 词元级 约束。我们发现,此类约束会不加区别地惩罚偏差;当政策试图超越参考时,这可能会翻转验证者确定的方向,从而抑制收益。为了解决这个问题,我们提出了单向策略优化(OW​​PO),这是一种基于优化方向与更新幅度解耦原理的方法。在OWPO中,验证者决定更新方向,而参考策略仅用于调整幅度。具体来说,OWPO 应用非对称重新加权:它对劣势偏差(策略落后于参考)执行加速对齐,对优偏差(策略超过参考)执行增益锁定。此外,通过合并迭代参考更新,OWPO 创建了持续巩固收益的“棘轮效应”。实验结果表明,OWPO 的性能优于强基线,包括 DAPO、OPD 和 MOPD,突破了固定先验的瓶颈,能够在不依赖外部参考模型的情况下实现持续的自我进化。