论文
通过对比互信息进行高效的过程奖励建模
Efficient Process Reward Modeling via Contrastive Mutual Information
摘要
最近的研究投入了大量精力,使用过程奖励模型(PRM)和其他验证器模型来验证思想链(CoT)轨迹的中间推理步骤。然而,训练 PRM 通常需要人工注释者为每个推理步骤分配奖励分数,这既昂贵又耗时。由于 LLM 的重复轨迹采样,现有的自动化方法(例如蒙特卡罗 (MC) 估计)也需要大量计算资源。为了克服这些限制,我们提出了对比逐点互信息(CPMI),这是一种新颖的自动奖励标记方法,它利用模型的内部概率来推断步骤级监督,同时显着减少注释数据集的计算负担。 CPMI 量化推理步骤相对于硬阴性替代方案增加了该步骤与正确目标答案之间的互信息的程度。这种对比信号可以作为该步骤对最终解决方案贡献的代理,并产生可靠的奖励。实验结果表明,与 MC 估计相比,基于 CPMI 的标记可减少 84% 的数据集构建时间和 98% 的标记生成时间,同时在流程级评估和数学推理基准上实现更高的准确性。