论文
探针分数有多高:可解释性评测的下限、上限与提升空间
How High Is 0.6? Floors, Ceilings, and Headroom in Interpretability Probing
摘要
探针是可解释性的常用工具:若隐状态能预测某变量,便称模型表征它。但分数没有固定含义, $R^2=0.6$ 可能只反映输入已透露的信息,同分在不同数据上意义也不同。我们建议用两参照解释分数:下限是一组声明的简单输入所能预测,上限是完整输入所能预测。两者差值为提升空间,探针在此范围内才可显示超出简单输入的计算。我们证明提升空间可因两条件消失:目标不再依赖必须推断的隐变量,或输入不再透露该变量。在上下文元分析Transformer中,两参照已知,模型需推断研究间隐异质性以正确加权。分布偏移使探针分数下降、误差增大12—15倍,但恢复的提升空间比例相似,说明数据丢失信息而非表征退化。真实模型中,scGPT仅部分编码生物变异。我们还复查LLM地理、黑白棋状态、真值及用户人口特征的四项著名探针研究:相对仅用输入文字的下限,部分主张成立,另一些主要由文本自身解释。
