论文
ReDiPPO:面向数学推理的参考引导价值校准与差异感知token重加权
ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning
摘要
强化学习已成为提升大语言模型数学推理能力的有效范式。在现有策略优化方法中,近端策略优化(PPO)仍然格外有吸引力,因为其学习到的评论家(critic)原则上可提供词元级信用分配。然而,在以长推理链与稀疏结果奖励为特征的数学推理任务中,可靠的词元级信用分配仍具挑战性。标准评论家往往无法准确评估中间推理状态,导致优势估计带噪、策略更新次优。本文提出ReDiPPO,一个用于数学推理的参考引导且差异感知的PPO框架。ReDiPPO引入参考引导评论家,将参考答案作为训练期特权信号,以提供更准确的价值估计。同时,它保留一个标准评论家,并量化标准价值估计与参考引导价值估计之间的词元级参考-标准差异。该差异可作为困难推理状态的指示器,用于在PPO优化过程中对相应词元级优势进行重加权。在多样化数学推理基准上的大量实验表明,ReDiPPO提升了价值估计精度,并在最终推理性能上持续超越PPO、DAPO、GSPO等强策略优化基线。代码已发布于 https://github.com/cii030/ReDiPPO。
