论文

ReDiPPO:面向数学推理的参考引导价值校准与差异感知token重加权

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

模型训练强化学习RLVR

摘要

强化学习已成为提升大语言模型数学推理能力的有效范式。在现有策略优化方法中,近端策略优化(PPO)仍然格外有吸引力,因为其学习到的评论家(critic)原则上可提供词元级信用分配。然而,在以长推理链与稀疏结果奖励为特征的数学推理任务中,可靠的词元级信用分配仍具挑战性。标准评论家往往无法准确评估中间推理状态,导致优势估计带噪、策略更新次优。本文提出ReDiPPO,一个用于数学推理的参考引导且差异感知的PPO框架。ReDiPPO引入参考引导评论家,将参考答案作为训练期特权信号,以提供更准确的价值估计。同时,它保留一个标准评论家,并量化标准价值估计与参考引导价值估计之间的词元级参考-标准差异。该差异可作为困难推理状态的指示器,用于在PPO优化过程中对相应词元级优势进行重加权。在多样化数学推理基准上的大量实验表明,ReDiPPO提升了价值估计精度,并在最终推理性能上持续超越PPO、DAPO、GSPO等强策略优化基线。代码已发布于 https://github.com/cii030/ReDiPPO。

ReDiPPO:面向数学推理的参考引导价值校准与差异感知token重加权:论文配图
图 1:RLVR 中学分分配的定性比较。 (a) 无批评的 GRPO 变体广播统一的响应级别信号。 (b) 基于批评家的 PPO 使用标准批评家,但无法访问参考答案。 (c) ReDiPPO 将其批评者的条件放在参考答案上,以获得更可靠的词元级信用分配。