论文
Limited Reasoning Space:LLM 长程推理的牢笼
Limited Reasoning Space: The cage of long-horizon reasoning in LLMs
摘要
测试时计算策略(如思维链 CoT)显著增强了大语言模型解决逻辑推理等复杂任务的能力。然而,实证研究表明,当采用 CoT 等典型任务分解策略时,单纯增加计算预算有时会导致测试时性能崩溃。这项工作假设,更大计算预算下的推理失败源于静态规划方法,因为静态规划几乎无法感知 LLM 推理的内在边界。我们将其命名为 Limited Reasoning Space 假设,并通过非自主随机动力学系统的视角进行理论分析。这一洞见表明,计算预算存在一个最优区间;过度规划会导致冗余反馈,甚至可能损害推理能力。为了利用计算扩展的收益并抑制过度规划,这项工作提出了 Halo,一个面向 LLM 规划的模型预测控制框架。Halo 面向长程任务设计,采用基于理由的规划,并构建了一个熵驱动的双控制器,采取 Measure-then-Plan 策略以实现可控推理。实验结果表明,Halo 通过在推理边界处动态调节规划,在复杂长程任务上优于静态基线。
