论文

Limited Reasoning Space:LLM 长程推理的牢笼

Limited Reasoning Space: The cage of long-horizon reasoning in LLMs

模型推理测试时计算扩展

摘要

测试时计算策略(如思维链 CoT)显著增强了大语言模型解决逻辑推理等复杂任务的能力。然而,实证研究表明,当采用 CoT 等典型任务分解策略时,单纯增加计算预算有时会导致测试时性能崩溃。这项工作假设,更大计算预算下的推理失败源于静态规划方法,因为静态规划几乎无法感知 LLM 推理的内在边界。我们将其命名为 Limited Reasoning Space 假设,并通过非自主随机动力学系统的视角进行理论分析。这一洞见表明,计算预算存在一个最优区间;过度规划会导致冗余反馈,甚至可能损害推理能力。为了利用计算扩展的收益并抑制过度规划,这项工作提出了 Halo,一个面向 LLM 规划的模型预测控制框架。Halo 面向长程任务设计,采用基于理由的规划,并构建了一个熵驱动的双控制器,采取 Measure-then-Plan 策略以实现可控推理。实验结果表明,Halo 通过在推理边界处动态调节规划,在复杂长程任务上优于静态基线。

Limited Reasoning Space:LLM 长程推理的牢笼
图3:Halo 框架:让推理动力学形成闭环。上:标准 Chain-of-Thought 运行于开环状态(open-loop regime),随机误差在不受约束的情况下不断累积,直至轨迹遭受严重退化。下:Halo 引入一个由三个阶段构成的模型预测控制(Model Predictive Control, MPC)回路:(1) 观察器(Observer,见第 3.1 节)通过平均注意力熵 ℋ \mathcal{H} 估计瞬时漂移率 λ ^ t \hat{\lambda}_{t} ;(2) 控制器(Controller,见第 3.2 节)对照容忍阈值 Ψ \Psi 跟踪累积不确定性 Ω t \Omega_{t} ;(3) 执行器(Actuator,见第 3.3 节)通过语义压缩与历史重置执行轨迹矫正(Trajectory Rectification),将系统投射回稳定空间,并将不确定性分数重置为 Ω t ← 0 \Omega_{t}\leftarrow 0 。