论文

从正确性到实用性:基于增益的 LLM 推理前缀评估

From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

模型训练奖励建模与过程监督

摘要

推理前缀塑造了 LLM 问题解决的未来轨迹,但现有的过程奖励模型通常通过局部步骤正确性来评估它们。我们认为,正确性是我们最终关心的效果的有用但间接的代理:前缀是否会增加成功完成的概率。我们将这种效应定义为前缀增益,即通过在前缀上调节轻量级学生模型组而引起的解决率改进,并使用它来训练具有简单的成对排名目标的前缀效用模型(PUM)。 PUM 学习基于结果的前缀效用,并且可以对完整轨迹和部分推理前缀进行评分。在 Best-of-$N$ 选择、集束搜索和数学推理强化学习中,PUM 提供了强大的前缀级监督信号,特别是当候选池很大、搜索预算增加或基于规则的奖励稀疏时。我们在 https://zhiqix.github.io/pum-project-page 发布了所有数据、模型和代码。