论文

分配过程奖励模型:通过条件最优传输对未来奖励进行校准预测

Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport

模型训练奖励建模与过程监督

摘要

推理时间缩放方法依赖于过程奖励模型 (PRM),该模型通常校准不佳并且高估了成功概率。据我们所知,我们建议首先使用条件最优传输来校准 PRM,修改条件 OT (CondOT) 地图学习 \cite{bunne2022supervised} 来估计由 PRM 估计的成功概率的单调条件分位数函数,以 PRM 隐藏状态为条件。这产生了结构上有效的分位数估计,并能够有效提取任意级别的置信界限,我们将其集成到 \cite{park2025know} 的实例自适应缩放(IAS)框架中。我们评估涵盖中等难度问题 (MATH-500) 和较难的分布外问题 (AIME) 的数学推理基准。对于具有可靠排名信号的 PRM,我们的方法比未校准的 PRM 和分位数回归显着改进了校准。在下游 Best-of-N IAS 性能方面,我们的方法通常比未校准的 PRM 有所改进。这些结果将条件最优传输确立为 PRM 校准的另一种原则性和实用方法,提供结构保证和灵活的不确定性估计。