论文

探针分数有多高:可解释性评测的下限、上限与提升空间

How High Is 0.6? Floors, Ceilings, and Headroom in Interpretability Probing

模型评测模型行为与机制分析

摘要

探针是可解释性的常用工具:若隐状态能预测某变量,便称模型表征它。但分数没有固定含义, $R^2=0.6$ 可能只反映输入已透露的信息,同分在不同数据上意义也不同。我们建议用两参照解释分数:下限是一组声明的简单输入所能预测,上限是完整输入所能预测。两者差值为提升空间,探针在此范围内才可显示超出简单输入的计算。我们证明提升空间可因两条件消失:目标不再依赖必须推断的隐变量,或输入不再透露该变量。在上下文元分析Transformer中,两参照已知,模型需推断研究间隐异质性以正确加权。分布偏移使探针分数下降、误差增大12—15倍,但恢复的提升空间比例相似,说明数据丢失信息而非表征退化。真实模型中,scGPT仅部分编码生物变异。我们还复查LLM地理、黑白棋状态、真值及用户人口特征的四项著名探针研究:相对仅用输入文字的下限,部分主张成立,另一些主要由文本自身解释。

探针分数有多高:可解释性评测的下限、上限与提升空间:论文原图
图1:按下限与上限归一化的探针 $R^{2}$。对目标 $T$ 的原始可解码性 $R^{2}_{H}$,在受限信息 $O$ 可实现的估计下限 $\hat{\rho}_{O}^{2}$ 和完整信息 $I$ 可实现的估计上限 $\hat{\rho}_{I}^{2}$ 之间归一化;差值为提升空间 $\Delta$。