论文
以习得的可靠性处理奖励
Process Rewards with Learned Reliability
摘要
过程奖励模型 (PRM) 为推理提供步骤级反馈,但当前的 PRM 通常只为每个步骤输出一个奖励分数。因此,下游方法必须将不完美的步骤级奖励预测视为可靠的决策信号,而不指示何时应信任这些预测。我们提出了 BetaPRM,这是一种分布式 PRM,可以预测步骤级成功概率和预测的可靠性。考虑到蒙特卡罗延续的逐步成功监督,BetaPRM 学习 Beta 信念,通过 Beta 二项式似然解释观察到的成功延续数量,而不是回归到有限样本成功率作为点目标。这种学习到的可靠性信号表明何时应该信任步骤奖励,使下游应用程序能够区分可靠的奖励和不确定的奖励。作为一种应用,我们引入了自适应计算分配 (ACA),用于 PRM 引导的 Best-of-N 推理。当高奖励解决方案可靠时,ACA 使用学习到的可靠性信号停止,并在不确定的候选前缀上花费额外的计算。跨四个骨干网和四个推理基准的实验表明,BetaPRM 改进了 PRM 引导的 Best-of-N 选择,同时保留了标准的步骤级错误检测。在此信号的基础上,ACA 提高了准确性——与固定预算 Best-of-16 相比的词元权衡,将词元使用量减少了 33.57%,同时提高了最终答案的准确性。