论文
列表策略优化:基于组的 RLVR 作为 LLM 响应单纯形上的目标投影
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
摘要
具有可验证奖励的强化学习(RLVR)已成为 大语言模型(LLM)后训练 激励推理能力的标准方法。在现有的方法中,基于组的策略梯度很流行,它根据提示对一组响应进行采样,并通过组相对优势信号更新策略。这项工作揭示了这些优化策略共享一个共同的几何结构:每个策略隐式定义响应单纯形上的目标分布,并通过一阶近似向其投影。基于这一见解,我们提出列表式策略优化(LPO)来显式地进行目标投影,通过将最近的 RL 目标限制为响应单纯形来揭开隐式目标的神秘面纱,然后通过精确的散度最小化来投影策略。该框架提供了(i)具有有界、零和和自校正投影梯度的列表目标的单调改进,以及(ii)通过解耦投影步骤具有不同结构属性的发散选择的灵活性。在不同的推理任务和 LLM 主干上,LPO 在匹配目标下持续提高典型策略梯度基线的训练性能,同时本质上保持优化稳定性和响应多样性。