论文
从装饰到承重:任务难度塑造思维链的因果角色
From Decorative to Load-Bearing: Task Difficulty Shapes the Causal Role of Chain-of-Thought
摘要
思维链(CoT)监控只有在书面推理因果地约束答案时才有意义。我们提出续写式因果测试(continuation-based causal testing),一种消融-修补干预:扰动一个推理步骤、截断链条,并强制模型从被破坏的前缀续写。它测量 CoT 对最终答案的承重程度,这是一种不同于机制忠实性的行为概念。在 Gemma-2-9B-IT、Llama-3.1-8B-Instruct 与 DeepSeek-R1-Distill-Qwen-7B 上,针对 GSM8K、MMLU 与 BIG-Bench Hard,CoT 承重度跟随模型相对任务难度变化:在简单任务上模型静默绕过自己的推理;在困难任务上它们跟随被破坏的步骤并传播错误。匹配的 2x2 分析显示任务难度主导扰动类型:从 GSM8K 到 BBH 多步算术,错误传播上升 16 倍;对 28,584 条续写的方差分解将 98.8% 的可解释偏差归于任务难度,仅 0.8% 归于扰动类型。推理专用 RL 抑制错误传播并压缩该梯度。四变体评委敏感性分析与双人盲评(n=500)表明错误传播与非传播标签对评委提示不变,标注者间完全一致(Cohen's kappa=1.00)。这一梯度给基于 CoT 的监督与 AI 安全监控带来结构性问题:轨迹易读之处信号很少,而信号关键之处错误在监控者介入前就已传播。隐藏态上的线性探针能区分静默绕过、自我纠正与错误传播,但加性激活转向只提供有限的因果控制,至多翻转约 25% 的错误传播案例。行为模式可读,但不可被可靠控制。
