论文

推理陷阱:封闭系统多步 LLM 推理的信息论界限

The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning

模型评测模型行为与机制分析

摘要

当同一语言模型的副本被提示进行辩论时,它们会产生一种观点的不同措辞,而不是不同的观点。多智能体辩论 (MAD) 以及更广泛的封闭系统推理(智能体迭代地转换彼此的输出)往往会保持答案的准确性,同时降低这些答案背后的推理能力。我们将多智能体案例命名为“辩论陷阱”,将更广泛的现象命名为“推理陷阱”,提供了基于证据的推理失败的程序化理论。该框架由三个部分组成:(i)SFS(支持的 忠实性 分数),一个声明级度量,根据提供的证据验证分解的原子声明(分解器不变排名:Spearman rho=1.0); (ii) EGSR(以证据为基础的苏格拉底推理),用以证据为基础的探究取代对抗性论证; (iii) 定理 1(DPI 边界):在标准 MAD 下,链 E -> O^0 -> O^1 -> ... 是马尔可夫,并且数据处理不等式意味着 E[I(E;O^{t+1})] <= E[I(E;O^t)]。三个伴随结果——开放系统恢复(定理 2)、EGSR 累积(引理 2)和投票聚合下限(命题 1)——通过与 E 的信息理论关系划分多步 LLM 推理。在 SciFact(300 项声明)和 FEVER(1,000 项声明)的 16 个条件中,DebateCV (C13) 保留了 88% 的基线精度,而 SFS下降 43%;多数票 MAD (C15) 将 SFS 降低至基线的 1.7% (p < 10^{-6}, d = -0.96); EGSR 恢复 98%。一项 R6 队列研究(韩语 n=10x30 FEVER;英语 n=3x200 SciFact)发现,评估者间 Fleiss kappa <= +0.018,且不同语言和领域的 Likert 评估者内部变化为 0.8-1.4 - 忠实性 指标校准所依据的人类一致性本身并不稳定。我们提供一个可证伪的猜想:任何保留定理 1 的马尔可夫结构的封闭系统推理协议都符合相同的 DPI 界限。