论文
模特们知道他们为什么改变主意吗?知识冲突下思想链的可解释性与忠实性
Do Models Know Why They Changed Their Mind? Interpretability and Faithfulness of Chain-of-Thought Under Knowledge Conflict
摘要
当语言模型看到文档与其训练知识相矛盾时,它必须选择:遵循文档或信任本身。先前的研究证明,这种选择取决于事实的知名度。我们问:模型的思想链(CoT)推理是否忠实地报告了这种机制?我们引入内省式 忠实性 并通过 200 个问题、8 个模型和 4 个提示条件对其进行测试。我们发现 CoT 推理在相反的决策中高度稳定:翻转对保留 96% 的相同答案相似性(d=0.34;由 ROUGE-L 确认,d=0.45)。然而,自评信心带有微弱的真实信号:对于实体名气无法提供信息的模糊事实,信心仍然可以预测决策(p <0.001)并跟踪项目级知识(r = 0.134)。 GPT-4o 是唯一具有统计上可靠的推理-决策耦合的模型。 Claude Sonnet 4.6 显示了最宽的置信范围 (SD=1.39),但合并相关性接近于零,因为置信-决策关系在条件之间颠倒;温度消融证实这是特定于模型的。内部思考词元比面向用户的 CoT 显示出更高的决策敏感性 (p=0.033)。 CoT 分解为决策不变的知识显示(~96%)和具有微弱但真实信号的薄置信层。对于监控:阅读信心,而不是争论。