论文

LLM 推理的 RL 更新的关键因素是什么?

What are Key Factors for Updates in RL for LLM Reasoning?

模型训练强化学习

摘要

可验证奖励的强化学习(RLVR)已成为增强 大语言模型 推理能力的有前途的框架。然而,现有的大部分工作都是以启发式直觉为指导的,导致不同的算法选择,甚至是相互矛盾的算法选择,但仍报告了经验收益。为了更好地理解这一现象,我们对 RLVR 更新进行了理论分析。我们的研究表明,离策略 程度的差异(由每条采样轨迹的梯度步数决定)会极大地影响重要性采样率的分布及其裁剪行为,从而改变哪些词元主导更新。基于这一见解,我们将梯度期望描述为控制更新动态的中心量,并分析词元概率、优势和重要性采样比的作用。受这些发现的启发,我们提出了自适应裁剪策略优化(ACPO),它根据词元组重要性采样率的经验方差来调整词元组之间的裁剪边界。在不同推理基准(涵盖数学问题解决、表格 QA 和逻辑难题)上对 3B 和 7B 模型进行的实验表明,ACPO 的性能优于 DAPO 和 CISPO 等强大的基线。这些结果表明,有原则的、分析驱动的方法可以产生更稳健、更有效的 RLVR 方法。代码位于:https://github.com/Control-derek/ACPO