论文

释放隐性奖励:用于分布级优化的前缀值学习

Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization

模型训练奖励建模与过程监督

摘要

过程奖励模型 (PRM) 为推理提供细粒度的监督,但可靠的 PRM 通常需要步骤注释或繁重的验证管道,这使得它们在在线 RL 期间扩展和刷新成本高昂。隐式 PRM 通过训练轨迹级结果标签的对数似然比奖励来降低这种成本。然而,对数比在训练期间仅被限制为序列级聚合,而推理将其分解为部分前缀的标记级或步骤级分数。这种训练与推理的不匹配使得本地信用的识别能力很弱,因此整个发行版的评分可能会放大误导性的优势。我们提出隐式前缀值奖励模型(IPVRM),它直接从结果标签中学习每个前缀的最终正确概率。然后获得步进信号作为连续前缀值之间的时间差 (TD) 差异,从而使训练目标与推理时间使用保持一致。 IPVRM 显着改进了 ProcessBench 上的步骤验证 F1。为了在策略优化期间利用这些前缀值,我们进一步引入了分布级 RL (DistRL),它将 TD 优势应用于采样词元和高概率候选词元,提供密集的反事实更新,而无需额外轨迹采样。实验表明,DistRL 带来的收益有限且隐式奖励不可靠,但与 IPVRM 配合使用时可以持续改善下游推理。我们的方法的实现可以在 https://github.com/gaoshiping/IPVRM 上找到。