论文
从概念对齐到因果扎根:思想链忠诚度的干预测试
From Concept Alignment to Causal Grounding: An Intervention Test of Chain-of-Thought Faithfulness
摘要
思想链 (CoT) 听起来似乎有道理,但并不忠实于模型的基本推理。大多数先前的工作通过输入输出行为或输入归因来探究 CoT 的忠实度,而内部计算在很大程度上尚未得到充分探索。相反,我们将忠实性视为内部概念基础:大型语言模型(LLM)的 CoT 推理是否涉及支持 LLM 直接预测的相同内部概念,以及共享概念是否因果驱动其答案?使用单个共享稀疏自动编码器 (SAE) 对预测通道和 CoT 通道进行编码,SAE 是大语言模型使用的潜在概念的可靠近似器,使它们的内部概念可以直接进行比较。我们引入了概念级对齐的三个相关度量和一个因果度量 $\Delta p$,它消除了共享概念并测量了答案概率的下降。正如相关指标所示,在五个大语言模型和四个数据集中,概念一致性普遍较高;然而,这些仅确定了哪些概念是共享的,而不是它们在因果上的贡献有多大。 $\Delta p$ 填补了这一空白:因果忠实度随模型深度变化很大,在中后期层而不是最终层达到峰值,并且模型尺度重塑了逐层轮廓。此外,因果关系中重要的共享概念并不总是在 CoT 中用语言表达。这些分离表明,仅从表面或代表性的对应关系无法可靠地评估忠诚度;评估它需要对 CoT 背后的内部概念是否真正驱动模型的预测进行因果测试。