论文

基于电路引导内外部差异的不忠实思维链检测

Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy

模型评测评测方法与指标

摘要

思维链(Chain-of-Thought, CoT)推理提升了大语言模型(LLM)的问题解决能力,但生成的推理轨迹可能无法忠实反映模型的真实决策过程。现有的CoT不忠实性检测器主要依赖生成理由中的外部信号,例如文本合理性或答案一致性,而忽视了来自模型内部计算的证据。尽管近期的电路追踪方法通过追踪推理过程中信息如何在模型组件间流动,提供了一种获取模型内部证据的途径,但为长CoT构建完整推理电路成本高昂且难以扩展。为应对这些挑战,我们提出Circuit-guided Internal-External Discrepancy Scorer(CIE-Scorer),一个面向实例级CoT不忠实性检测的框架。其核心思想是:忠实的推理轨迹应当与模型的计算过程保持一致,而不忠实的轨迹则可能偏离该过程。CIE-Scorer从信息量丰富的推理token中高效追踪紧凑的句子级电路,构建内部与外部推理图,并利用Fused Gromov-Wasserstein距离度量二者之间的差异。在FaithCoT-Bench四个数据集上的实验表明,CIE-Scorer在降低电路构建成本的同时取得了最先进的性能,证明了将机械可解释性信号与外部推理轨迹相结合用于CoT不忠实性检测的有效性。

基于电路引导内外部差异的不忠实思维链检测:论文配图
图 1:用于 CoT 不忠检测的 CIE-Scorer 概述。该框架选择信息推理标记并从模型激活中跟踪句子级内部归因电路。这些内部电路表示与外部基于文本的推理表示进行比较。两个推理图之间的差异是使用 FGW 距离来测量的。