论文

没有无效样本的 RLVR:LLM 推理的组优先 离策略 优化

RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为增强 大语言模型(LLM)推理能力的强大范例。然而,无效训练数据的普遍存在严重阻碍了其有效性:许多采样提示产生的响应组要么完全正确,要么完全错误,导致零方差奖励和有限的学习信号。最近最先进的方法通过广泛的 LLM 轨迹采样来过滤无效样本来解决这个问题,但代价是相当大的计算开销。包括预测采样和轨迹重播在内的替代方法旨在提高数据效率,但通常仍然不够,并且可能会引入其他问题,例如系统偏差或次优约束。为了解决这些限制,我们提出了组优先 离策略 优化(POPO),这是一个简单而有效的框架,可以充分利用有效的训练批次,而无需额外的轨迹采样开销。 POPO 包含两个关键组件:优先组重放和解耦 离策略 优化。前者通过基于新近度的重放机制,联合考虑样本质量和偏离策略的程度,用有效的 离策略 组替换无效的 同策略 组。为了进一步缩小 离策略 差距,POPO 采用解耦重要性采样来纠正 离策略 偏差,同时在一致的信任域约束下保持稳定的策略更新。对数学、规划和视觉几何等不同推理任务的实证评估表明,POPO 极大地加速了 RL 微调,并以显着减少的轨迹采样次数实现了强大的推理性能。