论文

面向推理的思维级束搜索

Thought-Level Beam Search for Reasoning

模型推理推理搜索与路径规划

摘要

测试时计算扩展是大型推理模型(LRM)性能的主要驱动因素,但极端的低效率限制了现有方法,使关键问题从"该花多少计算"转变为"该把计算分配到哪里"。我们将测试时推理形式化为对部分轨迹的受限计算分配问题。在固定硬件预算下,现有范式无法主动将计算分配给最有前景的部分进展:传统并行采样独立对待各条轨迹并引发严重的内存瓶颈,而减法式剪枝使硬件闲置,且无法主动、充分地移动输出分布。为克服这一二分困境,我们提出Gambit,一个执行思维级束搜索的推理算法。通过周期性剪除无前景的轨迹并立即从高质量前缀分支,Gambit借助探测隐藏状态的轻量评分器,将计算动态集中到最有前景的推理轨迹上,同时保持持续的高硬件利用率。跨多个模型与基准的广泛评估表明,Gambit严格优于现有基线。在相同硬件约束下,我们的方法在HMMT-24上较剪枝基线取得最高+6.7%的绝对准确率提升、在AIME-25上+3.3%,轨迹完成的吞吐量提高超过2倍,并且相对标准并行采样将总token消耗最多降低68.5%。

面向推理的思维级束搜索:论文配图
图4:Gambit在AIME问题上的端到端流程(容量C=5,交换规模K=2)。预热期间评估C=5条并行轨迹(颜色深浅表示进行中的得分s̄∈[0,1])。每隔Δ步进行一次锦标赛对活跃轨迹排序:得分最低的K=2条轨迹被剪除(×),并通过前缀缓存由得分最高的前缀派生的新分支替换(绿色箭头)。这种零和式重新分配在整个生成过程中始终保持恰好C条活跃轨迹。完成后,答案通过得分加权多数投票聚合,正确选出答案29(∑s̄=1.78 对 1.43)。