论文
超越前沿:面向高效测试时扩展的随机回溯
Beyond the Frontier: Stochastic Backtracking for Efficient Test-Time Scaling
摘要
测试时扩展通过投入额外算力探索多条解题轨迹来改进语言模型推理。关键挑战在于在最大化准确率的同时最小化推理期间生成的总token数。近期的PRM引导方法对中间前缀打分以引导搜索,但多数只关注前沿:它们仅保留当前活跃前缀,并使用带噪声的PRM分数不可逆地剪枝或重采样掉其余部分。这可能导致过早承诺、多样性坍缩,以及丢失仍可能获得正确延续的前缀。我们引入在持久的历史前缀池上的随机回溯,使测试时算力能够重新访问先前生成的状态,而不只是扩展当前前沿。为使其高效,我们提出两种互补机制。子池选择(Subpool Selection)通过在随机子池内施加Top-N选择来强化贪心的PRM引导搜索,让历史前缀有机会绕过被过高打分的前沿候选。幂回溯序贯蒙特卡洛(Power Backtrack Sequential Monte Carlo)使用幂次化PRM分数与混合校正权重,将SMC式重采样扩展到持久池。在多个数学推理基准与模型规模上,我们的方法持续实现更高的单位token数准确率,并相较强大的PRM引导基线仅用其一小部分token数即达到同等准确率,这表明持久池随机回溯为改善测试时扩展中的准确率-token权衡提供了一种简单而有效的途径。
