论文
确定性视界:扩展推理何时失效以及何时必须委派工具
The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary
摘要
扩展的思想链推理可能会降低确定性状态跟踪任务的性能,这不是由于偏好偏差,而是植根于仅解码器注意力的信息理论能力的限制。我们建立:(1)具有互补可实现性构造的注意力瓶颈定理,将状态跟踪能力限制为$O(H \cdot \log(L/H) \cdot \sqrt{d_h})$; (2) 上下文相关的误差模型产生超指数精度衰减; (3)状态空间Jaccard度量区分偏好失败的能力; (4) 确定性地平线 $d^* \in [19, 31]$ 超过该地平线就需要工具委派。在 12 个模型和 8 个任务域(包括 SWE-Bench、WebArena 和 SQL-Multi)中,工具集成推理始终优于神经思维链;在主要模型套件上,它的准确度达到 86-94%,而神经思维链的准确度为 24-42%。对最佳长度迹线进行微调可带来 $<5% 的改进,确认架构上限,并且高跨模型相关性 ($r = 0.81$-$0.91$) 表明这些失败是架构方面的而不是特定于训练的。我们的结果为纯神经推理何时应该屈服于代理系统中的混合方法提供了原则指导。