论文

思维链何时有用、何时有害:LLM 推理中串行深度瓶颈的实证研究

When Chain-of-Thought Helps and When It Hurts: An Empirical Investigation of the Serial-Depth Bottleneck in LLM Reasoning

模型评测模型行为与机制分析

摘要

人们普遍认为,思路链 (CoT) 提示可以普遍提高 LLM 推理能力。我们通过 H_dp 带宽界限的概念框架对此进行研究(Chen 等人,2024):虽然形式界限仅渐近绑定(在天文数字般大的提示长度下),但它确定了一个真正的架构瓶颈——超过 Transformer 的单通道容量的串行计算必须外部化,这就是 CoT 所做的。我们的主要发现是基准内串行深度梯度:单通道(无 CoT)精度随着每项串行深度单调降低,而 CoT 近似深度不变。我们在实际上下文长度下测量了三个指令调整模型(Qwen-2.5-7B/32B、Llama-3.1-8B)和五个标准 NLP 基准的 CoT 效果。在高深度 P-complete 任务(GSM8K、MATH)上,CoT 在所有模型中给出了 +54 到 +68 pp 的恢复差距。在浅层 TC^0 任务(MMLU、ARC)上,CoT 在结构上是冗余的(Delta 在 [0.0, +4.6] pp 中,没有显着的负面影响)——尽管高无 CoT 基线(在 ARC 上高达 95%)可能反映了污染,因此这个 null 不是一个干净的架构测试。中间类 L (HumanEval) 显示依赖于模型大小的转换:+23.2 pp (32B)、+9.1 pp (8B)、-28.7 pp (7B)。跨基准深度恢复相关性为 Spearman rho = 0.661(p = 0.007,n = 15); 15 个基准级 McNemar 测试中有 9 个在 Bonferroni 校正后显着。在 OSF 上预先注册,我们的结果表明 CoT 不是通用推理增强器,而是充当带宽旁路:它有助于串行计算,从而使单通道容量紧张,并且对于已经适合的任务来说是冗余的。