论文

LamPO:推理语言模型的 Lambda 风格策略优化

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为改进数学、编码和科学问答等任务的推理语言模型的有效范例。然而,广泛使用的群体相关目标(例如 GRPO)用标量统计总结每个采样群体,因此丢弃了候选响应之间的细粒度关系信息。这会削弱稀疏结果奖励下的贡献分配,特别是当多个生成的解决方案仅在推理质量上略有不同时。我们提出 \textbf{LamPO},一种 \textbf{Lambda 式策略优化}方法,用 \emph{成对分解优势} 代替标量组优势。 LamPO 聚合每个响应组内的成对奖励差距,并通过根据序列对数概率差异计算的置信感知权重来调节每次比较,同时保留 PPO 式优化的无批评和剪辑更新结构。当参考解决方案可用时,我们进一步添加基于 ROUGE-L 的轻量级密集辅助奖励,以减少奖励稀疏性。使用 Qwen3-1.7B、Qwen3-4B 和 Phi-4-mini 在 AIME24、AIME25、MATH-500 和 GPQA-Diamond 上进行的实验表明,LamPO 比 GRPO 和最近的 RLVR 变体持续改进,具有更稳定的训练动态和更好的样本效率。