论文

在思维链之前解码答案:来自 Pre-CoT 探针和激活指导的证据

Decoding Answers Before Chain-of-Thought: Evidence from Pre-CoT Probes and Activation Steering

模型评测模型行为与机制分析

摘要

随着思想链 (CoT) 已成为扩展大语言模型 (LLM) 推理能力的核心,它也已成为一种有前途的可解释性工具,表明有机会通过语言推理来理解模型决策。然而,CoT 对可解释性的效用取决于它的忠实度——模型陈述的推理是否反映了潜在的决策过程。我们提供了机械证据,表明指令调整模型通常在生成 CoT 之前确定其答案。在 CoT 之前的最后一个标记处训练残差流激活的线性探针,我们可以在大多数任务上以 0.9 AUC 预测模型的最终答案。我们发现这些方向不仅具有预测性,而且具有因果性:在超过 50% 的情况下,沿着探测方向的转向激活会翻转模型答案,显着超过正交基线。当转向导致错误答案时,我们观察到两种不同的失败模式:非蕴含(陈述正确的前提但得出不受支持的结论)和虚构(捏造错误的前提)。虽然当模型具有正确的 CoT 前信念时,事后推理可能很有用,但这些失败模式表明,当根据错误信念进行推理时,可能会导致不良行为。

思维链中的事后推理:解码与转向预先确定的答案
图4:在被转向(steering)翻转了答案的样本上,跨模型与数据集的CoT分类结果。对于给定的转向设置,来自 S yes S_{\text{yes}} 与 S no S_{\text{no}} 的样本被汇总统计。