论文
通过不透明串行深度量化思维链的必要性
Quantifying the Necessity of Chain of Thought through Opaque Serial Depth
摘要
大语言模型(LLM)倾向于把推理外化于思维链,使思维链成为监控的良好目标。这部分是Transformer架构的固有特性:足够长的串行认知必须经过思维链(Korbak等,2025)。我们以「不透明串行深度」形式化该论证:即不借助思维链等可解释中间步骤所能完成的最长计算的长度。基于该形式化,我们计算了Gemma 3模型不透明串行深度的数值上界,并给出标准LLM之外其他架构的渐近结果。我们还开源了可计算任意神经网络不透明串行深度上界的自动化方法,并用它证明MoE模型的深度可能低于稠密模型。总体而言,结果表明不透明串行深度是理解模型「重大推理不外化」潜力的有用工具。
