论文

当推理轨迹沦为表演:步级证据表明思维链是不完美的监督渠道

When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

模型评测模型行为与机制分析

摘要

思维链(CoT)轨迹日益被同时用于提升语言模型能力和审计模型行为,其隐含假设是可见轨迹与决定答案的计算保持同步。我们用一个步级的“检测-分类-比较”框架检验这一假设,该框架围绕答案承诺代理构建,并与Patchscopes、tuned-lens探针和因果方向消融交叉验证。在九个模型和七个推理基准上,潜在承诺与显式答案到达平均仅在61.9%的步骤上对齐。主导性的失配模式是虚构式延续:58.0%的检出失配事件发生在答案承诺代理已经稳定之后,而轨迹仍在继续生成看似深思熟虑的文本;空洞性分析表明,已承诺的答案在这些步骤中并不改变。在架构匹配的Qwen2.5/DeepSeek-R1-Distill对比中,推理流水线更多改变失败构成而非总体对齐度,这在32B上最为明显:虚构步骤减少而矛盾状态增多。更低的步级对齐还与更大的CoT效用相关,这表明最受益于CoT的设定往往在时间保真度上最差。成对截断和补充的供体损坏测试进一步表明,大量承诺后的文本对最终答案并不起支撑作用。这些发现表明,CoT可以仍然有用,同时仍是关于答案何时形成的不可靠报告。

当推理轨迹沦为表演:步级证据表明思维链是不完美的监督渠道:论文配图
图 7:(A) 12,004 个实例级峰值严重性的 Pearson 相关矩阵。 CT↔\leftrightarrowPC 对突出显示:r=0.937r=0.937,95% CI [+0.930,+0.943][+0.930,+0.943]。 (B) 三个活性类别的纯子组配对 Δ\Delta(治疗减去对照),具有 95% bootstrap CI。阴影条显示 Δvs U\Delta_{\text{vs U}}(均匀随机切割);实心条显示 Δvs N\Delta_{\text{vs N}} (匹配邻居 δ=±2\delta=\pm 2 步骤)。 CS 和 HR 均显示出显着的正 Δ\Delta,与 HR 的承载预测相反。 CT 方向为负但动力不足 (n=38n=38)。