论文

通过推理状态传播的学习过程奖励

Learning Process Rewards via Reasoning State Propagation

模型训练奖励建模与过程监督

摘要

过程奖励模型(PRM)通过提供用于评估中间推理状态的细粒度信号,在测试时计算扩展和强化学习方面表现出了显着的有效性,但它们的训练严重依赖于昂贵的过程注释。减轻这种依赖性的一个自然方法是用可扩展的结果监督来补充有限的过程监督。然而,现有的 PRM 通常独立地对推理前缀进行建模,没有提供有效使用最终结果来指导中间推理状态学习的明确机制。我们引入推理状态传播(RSP),它用二进制有效性状态表示每个推理前缀,并对推理轨迹上连续状态之间的转换进行建模。具体地,RSP预测有效状态变为无效的中断概率和无效状态恢复为有效的修复概率。通过传播这些转换,RSP 将中间状态连接到最终状态,允许过程注释监督中间状态,而结果标签监督最终状态,并可以为前面的步骤提供学习信号。在推理搜索、响应选择和强化学习方面,RSP 始终优于代表性 PRM 基线,在集束搜索中比 Qwen2.5-Math-PRM 平均提高 5.6%,在强化学习中平均提高 2.1%。