论文

超越前沿:面向高效测试时扩展的随机回溯

Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling

模型推理推理搜索与路径规划

摘要

测试时扩展通过投入额外算力探索多条解题轨迹来改进语言模型推理。关键挑战在于在最大化准确率的同时最小化推理期间生成的总token数。近期的PRM引导方法对中间前缀打分以引导搜索,但多数只关注前沿:它们仅保留当前活跃前缀,并使用带噪声的PRM分数不可逆地剪枝或重采样掉其余部分。这可能导致过早承诺、多样性坍缩,以及丢失仍可能获得正确延续的前缀。我们引入在持久的历史前缀池上的随机回溯,使测试时算力能够重新访问先前生成的状态,而不只是扩展当前前沿。为使其高效,我们提出两种互补机制。子池选择(Subpool Selection)通过在随机子池内施加Top-N选择来强化贪心的PRM引导搜索,让历史前缀有机会绕过被过高打分的前沿候选。幂回溯序贯蒙特卡洛(Power Backtrack Sequential Monte Carlo)使用幂次化PRM分数与混合校正权重,将SMC式重采样扩展到持久池。在多个数学推理基准与模型规模上,我们的方法持续实现更高的单位token数准确率,并相较强大的PRM引导基线仅用其一小部分token数即达到同等准确率,这表明持久池随机回溯为改善测试时扩展中的准确率-token权衡提供了一种简单而有效的途径。

超越前沿:面向高效测试时扩展的随机回溯:论文配图
图 1:仅前沿搜索和持久池回溯的示意图比较。仅前沿方法仅保留新生成的子项 ℬt\mathcal{B}_{t},因此无法重新访问未选择到下一个前沿的前缀。贪婪选择保留持久池并应用全局顶级排名,但较旧的正确前缀被(始终低于)在 t−1t-1 已选择的前缀阻止。 SPS 通过仅在随机子池内进行排名来解决此问题,从而为被阻止的历史前缀提供了另一个扩展的机会。 Power Backtrack SMC 通过加权重采样保留历史前缀,将保留的历史多重集 StS_{t} 与新生成的子集 ℬt\mathcal{B}_{t} 相结合。