论文
当推理轨迹沦为表演:步级证据表明思维链是不完美的监督渠道
When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel
摘要
思维链(CoT)轨迹日益被同时用于提升语言模型能力和审计模型行为,其隐含假设是可见轨迹与决定答案的计算保持同步。我们用一个步级的“检测-分类-比较”框架检验这一假设,该框架围绕答案承诺代理构建,并与Patchscopes、tuned-lens探针和因果方向消融交叉验证。在九个模型和七个推理基准上,潜在承诺与显式答案到达平均仅在61.9%的步骤上对齐。主导性的失配模式是虚构式延续:58.0%的检出失配事件发生在答案承诺代理已经稳定之后,而轨迹仍在继续生成看似深思熟虑的文本;空洞性分析表明,已承诺的答案在这些步骤中并不改变。在架构匹配的Qwen2.5/DeepSeek-R1-Distill对比中,推理流水线更多改变失败构成而非总体对齐度,这在32B上最为明显:虚构步骤减少而矛盾状态增多。更低的步级对齐还与更大的CoT效用相关,这表明最受益于CoT的设定往往在时间保真度上最差。成对截断和补充的供体损坏测试进一步表明,大量承诺后的文本对最终答案并不起支撑作用。这些发现表明,CoT可以仍然有用,同时仍是关于答案何时形成的不可靠报告。
