论文
过程奖励模型的隐藏偏差:奖励正确推理的棱镜
The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning
摘要
过程奖励模型 (PRM) 通过提供步骤级反馈来改进推理的贡献分配。然而,我们发现 PRM 中存在因步骤级训练数据严重不平衡而导致的隐藏偏差。标准的交叉熵训练放大了这种偏差,导致 PRM 过度相信看似合理但不正确的步骤,并产生很高的假阳性率。我们表明,这些误报具有不对称的下游效应:误报主要减缓探索,而误报则积极引导 Best-of-N 选择、引导解码和策略优化走向有缺陷的推理。这表明 PRM 训练应该从逐点标签拟合转向可靠的相对比较。为了解决这个问题,我们提出了 PRISM(改进步骤建模的精确排名),这是一种策略感知的 PRM 训练框架,可以从对比步骤级比较和时间前瞻策略生成的硬负例中学习,不需要新的人工标签。我们进一步使用难度意识课程来优化对比步距。在 PRMBench 和 ProcessBench 中,PRISM 大大减少了误报(PRMBench 上为 22%),并相对于强判别性 PRM 改进了宏 F1。当应用于策略优化和搜索任务(包括引导解码和 Best-of-N 选择)时,它能够持续提高准确性(引导解码高达 22%,Best-of-N 高达 33%)和鲁棒性。更广泛地说,值得信赖的过程监督不仅仅是分配高额奖励,而是以正确的理由奖励正确的推理。