论文

思想链不忠的两种机制:基于度量的检测在模型错误的情况下失败

Two Regimes of Chain-of-Thought Unfaithfulness: Metric-Based Detection Fails Where Models Are Wrong

模型评测模型行为与机制分析

摘要

思想链(CoT)解释只有在忠实的情况下才支持监督:所陈述的推理必须真正产生答案。根据 FaithCoT-Bench 的人工注释审核不忠实 CoT 的黑盒(行为)检测,我们发现答案正确性在各个层面上构建了问题。仅答案不正确性(预言机诊断,而不是可部署检测器)优于每个专用信号 (AUROC 0.696),因为 69% 的注释不忠实发生在不正确的答案上。按正确性进行分层将检测分为两种情况:对于正确答案,行为信号将忠实与事后推理适度分开(0.63-0.67);对于不正确的答案,最不忠实的地方,没有任何测试信号可以检测到高于机会(在基准范围信号的所有四个模型上都复制)。标准的步骤去除度量与人类标签反相关;这种反转在基准测试的发布分数和依赖提示的反事实标记痕迹上重现。线性探针解码 Llama-3.1-8B 中的行为盲状态和 Qwen-2.5-7B 中的正确答案状态,在不同状态之间没有检测到共享的、正向对齐的方向;在依赖于模型和源的设置中,指示的答案优先轨迹(7 个模型)不会转移到任何一个带注释的状态,而提示诱导的非语言答案翻转则会转移到这两个注释状态。我们还独立验证并解决基准标签语义中的文档数据不匹配问题。