论文

DeepLook:用前瞻实现更深思考

DeepLook: Deeper Thinking with Lookahead

模型推理测试时计算扩展

摘要

推理时扩展已成为改进大语言模型推理的强大范式,在困难推理任务上往往比单纯的参数扩展带来更大收益。然而,现有方法在推理轨迹内部分配计算的方式仍然低效。受「推理失败往往在错误答案显式出现之前就表现出早期不确定性」这一观察的启发,我们提出 DeepLook,一个免训练的监视-干预解码框架,将前瞻计算集中在不确定性瓶颈处。DeepLook 将 token 级置信度聚合为段级信号,当置信度相对近期历史下降时触发,并以固定视野的前瞻探索候选延续。分支按平均前瞻置信度(ALC)——即 rollout 延续上的平均段级置信度——排序,然后通过投票进行剪枝和聚合。在 DeepSeek-R1-8B、Qwen3-32B、GPT-OSS-20B 和 GPT-OSS-120B 上的四个竞赛级数学基准测试中,DeepLook 移动了准确率-token 成本帕累托前沿:它在16个设置中的11个上优于 DeepConf-low,同时平均减少87.3%的数据集级 token 生成,包括 Qwen3-32B 在 AIME25 上+3.1、GPT-OSS-20B 在 BRUMO25 上+8.8 的提升。这些结果表明,选择性的、面向未来的干预比均匀扩展完整推理轨迹带来显著更强的准确率-成本权衡。代码可从此处获取。

DeepLook:用前瞻实现更深思考:论文配图
图 3:词元与分段级别的置信度。为了便于阅读,每个段跨越两行 (L=32L{=}32)。片段背景编码片段级别的置信度 Ć\bar{C},其中红色背景表示不确定的片段。单个标记颜色 (CtC_{t}) 揭示了局部置信度波动,激发了分段级聚合以稳健地检测推理失败。