论文
DeepLook:用前瞻实现更深思考
DeepLook: Deeper Thinking with Lookahead
摘要
推理时扩展已成为改进大语言模型推理的强大范式,在困难推理任务上往往比单纯的参数扩展带来更大收益。然而,现有方法在推理轨迹内部分配计算的方式仍然低效。受「推理失败往往在错误答案显式出现之前就表现出早期不确定性」这一观察的启发,我们提出 DeepLook,一个免训练的监视-干预解码框架,将前瞻计算集中在不确定性瓶颈处。DeepLook 将 token 级置信度聚合为段级信号,当置信度相对近期历史下降时触发,并以固定视野的前瞻探索候选延续。分支按平均前瞻置信度(ALC)——即 rollout 延续上的平均段级置信度——排序,然后通过投票进行剪枝和聚合。在 DeepSeek-R1-8B、Qwen3-32B、GPT-OSS-20B 和 GPT-OSS-120B 上的四个竞赛级数学基准测试中,DeepLook 移动了准确率-token 成本帕累托前沿:它在16个设置中的11个上优于 DeepConf-low,同时平均减少87.3%的数据集级 token 生成,包括 Qwen3-32B 在 AIME25 上+3.1、GPT-OSS-20B 在 BRUMO25 上+8.8 的提升。这些结果表明,选择性的、面向未来的干预比均匀扩展完整推理轨迹带来显著更强的准确率-成本权衡。代码可从此处获取。
