论文
更好地探索顺序测试时计算扩展
Towards Better Exploration in Sequential Test-Time Scaling
摘要
测试时计算扩展通过在推理上花费额外的计算来改进语言模型推理。然而,这两类现有方法通常无法在很长的时间内持续改进。并行方法重复从模型中采样独立答案,对于模型不可能在一次尝试中解决的问题的扩展性很差。相比之下,顺序方法建立在以前的答案的基础上来获取新的想法,但到目前为止,尚未证明能够达到超出并行扩展所找到的答案。首先,我们表明顺序缩放通常会停止改进,因为它过早地陷入吸引子中:一组答案一旦输入,就会阻止探索不同的答案。在 27 种缩放方法、模型和基准的组合中,我们发现 53.8% 的顺序缩放轨迹在四次迭代内进入吸引子。其次,我们证明简单的模型混合干预有助于逃避吸引子。这将吸引子命中率平均降低了 21.2 个百分点,将解决方案覆盖范围扩展到计算匹配的并行基线之外,并将递归自聚合的准确性提高了至少 2.2 个百分点。我们的结果促使我们重新关注长期测试时计算扩展,从并行方法转向改进先前答案的顺序方法。