论文
可解码不等于因果:用SAE分解区分探针读出与行为驱动特征
Decodability is Not Causality: Dissociating Probe Readouts from Behavioral Drivers via SAE Decomposition
摘要
线性探针能从语言模型激活中解码真实性等安全相关概念,但探针准确率可能只表明可解码性,并不证明其加权特征在因果上驱动模型行为。我们说明,仅凭探针权重的几何结构无法弥合这一差距:与探针方向几何对齐的特征未必是模型实际使用的特征,因此因果相关性需要干预验证。我们提出特征级诊断,将已部署的真假探针分解为稀疏自编码器SAE特征,分别依据探针对齐程度和模型行为的梯度敏感度排序,再在连贯性门控下消融共同特征、仅探针特征及随机特征集合。对于Buerger等人2024年的真实性探针TTPD,在Long等人2025年为Gemma2-9B-Instruct设计的指令式真实与欺骗场景中,两种排名仅弱重叠,约12%,Spearman相关系数为0.10。消融清楚地区分二者:在保持完全连贯性时,探针与模型共同使用的特征使输出翻转最多27%,远高于同规模仅探针特征的6%和随机特征的1%;仅探针特征主要扰动探针自身读数。这种分离在五个随机种子和留出划分上均成立,考虑激活的特征选择使行为翻转频率接近几何排名最前特征的三倍,即17.6%对6.1%。因此,该设置下仅投影探针权重向量无法识别模型因果使用的特征;结合探针信息与特征激活统计能找到更多行为因果特征,而连贯性门控的SAE干预是将其与探针读出分离所必需的。
