论文

现成的 LLM 作为过程评分器:无需训练 数学推理 PRM 的替代品

Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning

模型推理解码与生成控制

摘要

使用更强的评分器从多个小模型样本中选择最佳响应是一种简单的推理时间策略,但当小模型已经致力于不正确的推理路径时会失败。 PRM 引导搜索通过在生成期间对候选延续进行评分来避免这种情况,但需要使用步骤级标签训练的奖励模型。我们提出了块级引导生成,这是一种 无需训练 替代方案,它使用现成的 大语言模型 作为流程评分器。在每一步中,小模型都会对 k 个固定长度的候选块进行采样,而较大的模型则使用似然性对候选块进行评分,而不生成任何文本。选定的块在下一步之前提交,在错误传播之前引导生成。我们用两个选择规则实例化这个框架:似然引导选择(LGS),它选择具有最高长度归一化大模型对数概率的块;对比引导选择(CGS),它减去小模型的对数概率,以支持大模型的偏好与小模型的偏好不同的块。我们表明,由于系统长度偏差即使在长度归一化后仍然存在,因此用大模型似然度对可变长度推理步骤进行评分是不可靠的,而固定长度块可以避免这种混淆。在 GSM8K、MATH、Minerva Math、AMC23 和 AIME24 上,其中 Qwen2.5-1.5B 由 Qwen2.5-32B 指导,Llama-3.2-1B 由 Llama-3.1-70B 指导,CGS 的表现优于多数投票高达 28 个百分点,并且在匹配的指导预算下,匹配或优于 Qwen2.5-Math-PRM-72B 指导搜索大多数基准测试,无奖励-模型训练。在 Qwen2.5-72B 的指导下,CGS 在 k=16 时在 MATH 上达到 81.8%,在 Minerva Math 上达到 63.6%,超过多数投票 4--6 个百分点。最后,块级引导生成产生的推理轨迹比 PRM 引导搜索短得多。