SIFT:分布转移下思维链推理的鲁棒元忠实度验证
SIFT: Robust Meta-Faithfulness Verification of Chain-of-Thought Reasoning Under Distribution Shift
摘要
思维链 (CoT) 忠实度检测器广泛用于审核推理模型,但检测器本身就是一个预测器,其判断被视为稳定的属性。我们询问探测器在分布偏移下是否忠实于自身。我们将元忠实性形式化为不变性原则:有效的检测器必须对痕迹返回相同的判断,这些判断仅通过保留地面真实忠实性的变换而有所不同。我们证明了三个结果:(i)仅使用干预响应曲线的检测器无法将具有相同特征的忠实机制与副现象机制区分开来; (ii) 任何依赖于位移敏感特征的检测器都会以与其分布精度无关的速率违反不变性; (iii) 渐进认证的选择性风险保证可以实现自信的弃权。我们在 FaithShift(一种跨越十个移位轴的压力测试协议)中实施了该原理,并提出了 SIFT,一种经过跨环境不变性目标和经过认证的弃权训练的隐藏状态轨迹检测器。通过 14,996 条轨迹、四个领域和八个模型,得出了三项发现。首先,传输崩溃是真实存在的:所有现有检测器都显示间隙 $\geq 0.15$ AUROC。其次,主要瓶颈是采样随机性,而不是偏移:超过 80% 的探测器不稳定源于随机种子变异,这歪曲了我们预先注册的预测,即偏移归因违规超过 0.25。第三,SIFT 比最佳单种子基线减少了 64% 的不变性违规,但是任何检测器的四种子集合将裕度缩小到 0.01(在匹配覆盖率下无法区分,$p=0.21$),并且 SIFT 需要 51% 的弃权率。跨模型传输从族内降级到跨族再到开放权重-to-API,部分被多模型训练关闭。我们为审计员提供了一个框架:真正的障碍是检测器方差,而不是分布偏移。
