论文
面向推理的思维级束搜索
Thought-Level Beam Search for Reasoning
摘要
测试时计算扩展是大型推理模型(LRM)性能的主要驱动因素,但极端的低效率限制了现有方法,使关键问题从"该花多少计算"转变为"该把计算分配到哪里"。我们将测试时推理形式化为对部分轨迹的受限计算分配问题。在固定硬件预算下,现有范式无法主动将计算分配给最有前景的部分进展:传统并行采样独立对待各条轨迹并引发严重的内存瓶颈,而减法式剪枝使硬件闲置,且无法主动、充分地移动输出分布。为克服这一二分困境,我们提出Gambit,一个执行思维级束搜索的推理算法。通过周期性剪除无前景的轨迹并立即从高质量前缀分支,Gambit借助探测隐藏状态的轻量评分器,将计算动态集中到最有前景的推理轨迹上,同时保持持续的高硬件利用率。跨多个模型与基准的广泛评估表明,Gambit严格优于现有基线。在相同硬件约束下,我们的方法在HMMT-24上较剪枝基线取得最高+6.7%的绝对准确率提升、在AIME-25上+3.3%,轨迹完成的吞吐量提高超过2倍,并且相对标准并行采样将总token消耗最多降低68.5%。
