论文

EST-PRM:在负载之前进行压力测试过程奖励模型

EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing

模型评测评测方法与指标

摘要

过程奖励模型(PRM)广泛应用于具有密集步骤级监督的 模型训练 语言中。他们假设 PRM 分数是标签保留变换下步骤正确性的稳定代理。这些转换改变了推理结构,但保留了最终答案。我们认为这个假设没有得到很好的验证。这种转换可以改变 PRM 分数与正确性信号的关系,从而导致模型之间出现不同的故障模式。为了解决这一差距,我们引入了 \textbf{EST-PRM},这是一种用于密集过程奖励的压力测试框架。它应用三种转换:(1) 步骤膨胀,(2) 依赖感知步骤重新排序,以及 (3) 置信标记。定义了漏洞分解,将奖励膨胀与正确性敏感性损失分开。在来自 MATH-500、GSM8K 和 PRMBench 的 4,687 个推理链上评估了 5 个 PRM 型模型。结果表明,不同模型之间的漏洞模式存在明显差异。 Math-Shepherd 对位置扰动表现出最强的敏感性,皮尔逊相关性下降了 0.152 \pm 0.038$,分数通货膨胀率达到 32.8 \pm 4.9\%$。 Qwen2.5-Math-PRM 受阶梯通胀影响最大,通胀率达到 $47.6 \pm 4.3\%$。基于置信度的扰动也会扭曲奖励校准,揭示正确性估计的不一致。评估了三种缓解策略,强调了鲁棒性覆盖率和误报率之间的权衡。