论文

可解码不等于因果:用SAE分解区分探针读出与行为驱动特征

Decodability is Not Causality: Dissociating Probe Readouts from Behavioral Drivers via SAE Decomposition

模型评测模型行为与机制分析

摘要

线性探针能从语言模型激活中解码真实性等安全相关概念,但探针准确率可能只表明可解码性,并不证明其加权特征在因果上驱动模型行为。我们说明,仅凭探针权重的几何结构无法弥合这一差距:与探针方向几何对齐的特征未必是模型实际使用的特征,因此因果相关性需要干预验证。我们提出特征级诊断,将已部署的真假探针分解为稀疏自编码器SAE特征,分别依据探针对齐程度和模型行为的梯度敏感度排序,再在连贯性门控下消融共同特征、仅探针特征及随机特征集合。对于Buerger等人2024年的真实性探针TTPD,在Long等人2025年为Gemma2-9B-Instruct设计的指令式真实与欺骗场景中,两种排名仅弱重叠,约12%,Spearman相关系数为0.10。消融清楚地区分二者:在保持完全连贯性时,探针与模型共同使用的特征使输出翻转最多27%,远高于同规模仅探针特征的6%和随机特征的1%;仅探针特征主要扰动探针自身读数。这种分离在五个随机种子和留出划分上均成立,考虑激活的特征选择使行为翻转频率接近几何排名最前特征的三倍,即17.6%对6.1%。因此,该设置下仅投影探针权重向量无法识别模型因果使用的特征;结合探针信息与特征激活统计能找到更多行为因果特征,而连贯性门控的SAE干预是将其与探针读出分离所必需的。

可解码不等于因果:用SAE分解区分探针读出与行为驱动特征:论文配图
图1:将生成前最后残差激活分解为稀疏自编码器特征,分别按探针权重对齐程度及模型真/假输出间隔的梯度敏感性排序。前者表示探针读取的特征,后者表示扰动对模型输出影响最大的特征;再干预两组特征及随机对照,测量模型行为、探针预测及输出连贯性变化。