论文
言明的推理步骤在因果上承重吗?
Are Stated Reasoning Steps Causally Load-Bearing?
摘要
思维链(CoT)监控假设模型写下的推理反映了直接产生其答案的计算。既往的忠实度度量以行为性测试为主:它们只是编辑推理文本并观察由此得到的答案。而我们的方法旨在在激活层面因果地测量忠实度,并专门针对模型自生成的推理。与以往测量性能退化的因果审计不同,我们的干预带有已知的预测目标:每次修补都应把答案切换到一个可由构造推导出的特定反事实实体。具体而言,我们使用合成多跳查找任务(2-6跳),用来自反事实运行的相应激活修补模型陈述每个中间步骤的token跨度的残差流。对Qwen3-4B,在最敏感的中层网络上,76.9%±2.8%的言明步骤是因果承重的(CLB)(随机位置零假设:11.3%;修补底层提示事实:83%,即言明步骤承载了约96%的可达效应)。此外,同一批条目上的标准行为测试得到88.2%,把因果忠实度高估了11.4个百分点(条目配对;111:14不一致对,p<1e-15),在最简单的条目上高估高达20个百分点。这一差距还有清晰的能力维度:Qwen3-1.7B整体因果忠实度低得多(54.8%),且随推理深度增加而崩塌(2跳68%到6跳30%),而Qwen3-4B保持相对平稳。尽管言明的推理可以具有因果意义,标准行为测试倾向于高估其因果忠实度,特别是在模型推理显得最流畅的简单样例上。