论文

通过优化引导器缓解数学推理中PRM引导搜索的过度优化

Mitigating Over-Optimization in PRM-Guided Search in Mathematical Reasoning by Optimizing the Guide

模型推理推理搜索与路径规划

摘要

过程奖励模型 (PRM) 为基于搜索的推理提供密集的步骤级指导,使推理时间计算能够分配给有希望的部分解决方案。然而,最近的证据表明,PRM 引导的搜索可能会过度优化不完美的过程奖励,修剪可行的轨迹,同时扩大虚假的轨迹。在这项工作中,我们从理论上证明,直接利用 PRM 分数很容易通过极值效应受到验证者噪音的影响:随着推理深度的增加,不可行的前缀更有可能获得虚假的高分。因此,我们将 PRM 引导搜索制定为针对合理奖励扰动的鲁棒优化问题,称为最大最小 PRM 引导搜索,从而形成一种无需训练的鲁棒过程监督方法,该方法可以在步骤级分数有噪声时保留有希望的替代方案。 Maximin PRM 引导搜索通过降低对过度优化的 PRM 异常值的敏感性来缓解这种故障模式。在没有微调或在线适应的情况下,maximin 搜索始终将 PRM 引导的搜索平均提高了 17-35%,在 16 个设置中的 14 个设置中优于结果和步骤级别基线。我们的源代码可在 https://github.com/tjoo512/maximin-search 获取。

通过优化引导器缓解数学推理中PRM引导搜索的过度优化:论文配图
图1 Maximin PRM制导搜索。在每个修剪步骤中,大语言模型首先产生候选人推理轨迹,然后由PRM来分配分数。我们的强势选手没有贪婪地只保留最有分数的候选人,而是在RBF KK核心下保留了毫米前缀,以平衡高PRM分数和多样性,使得搜索对吵闹的PRM分数不那么敏感。然后扩展选定的前缀, 程序重复 。