论文

LambdaPO:推理语言模型的 Lambda 风格策略优化

LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models

模型训练强化学习

摘要

组相对策略优化 (GRPO) 已成为现代强化学习调整的基石,因其通过利用采样轨迹群组之间的奖励标准化而消除明确的价值批评的功效而受到赞誉。然而,该方法对整体统计基线(例如组均值)的依赖将轨迹空间的关系拓扑压缩为单个标量,从而消除了导航复杂的、排名敏感的奖励景观所必需的细粒度偏好信息。为了解决这个问题,我们引入了一种新颖的框架,即 Lambda 策略优化 (LambdaPO),它通过将优势估计从标量值重新概念化为分解的成对偏好结构来解决这一信息论瓶颈。具体来说,任何给定轨迹的优势被公式化为与其队列中所有同行的奖励差异的综合总和,其中每个成对比较都会因策略自身对既定偏好的概率置信度而动态减弱。为了进一步减轻二元结果监督的稀疏性,我们通过语义密度奖励来增强目标,该奖励源自生成的推理轨迹和 真值 解决方案之间的精确回忆对齐。因此,我们的方法可以从一组采样轨迹中挖掘更细粒度的优化信号,引导 LLM 达到更好的优化。具有挑战性的数学推理和问答任务的实验结果表明,与基线方法相比,LambdaPO 提高了性能。