论文
无监督过程奖励模型
Unsupervised Process Reward Models
摘要
过程奖励模型 (PRM) 是一种强大的机制,通过提供细粒度、步骤级监督来引导 大语言模型 推理。然而,这种有效性的代价是巨大的:PRM 的每个推理步骤都需要专家注释,这使得它们成本高昂且难以扩展。在这里,我们提出了一种训练无监督 PRM (uPRM) 的方法,该方法不需要人工监督,既不需要逐步注释的级别,也不需要通过最终答案的 真值 验证。我们的方法背后的关键思想是定义一个从 LLM 下一个标记概率派生的评分函数,该函数联合评估一批推理轨迹中第一个错误步骤的候选位置。我们证明了 uPRM 在不同场景中的有效性:(i) 在识别 ProcessBench 数据集上的第一个错误步骤方面,uPRM 比 LLM-as-a-Judge 的绝对准确度提高了 15%; (ii) 作为测试时间扩展的验证器,uPRM 的性能与有监督的 PRM 相当,并且比多数投票基线高出 6.9%,并且 (iii) 当用作强化学习中的奖励信号时,与使用 真值 标签训练的有监督的 PRM 相比,uPRM 在整个训练过程中实现了更强大的策略优化。总的来说,我们的结果为复杂推理任务的可扩展奖励建模开辟了一条道路。