论文
代理保真度:什么时候可以打开 LLM 解释关闭的?
Surrogate Fidelity: When Can Open LLMs Explain Closed Ones?
摘要
机械可解释性 (MI) 需要完全访问模型内部结构,但最广泛部署的语言模型的 API 最多只能公开输出标记的对数概率。这就产生了一个替代问题:在开放模型上进行的测量何时允许我们对封闭模型提出主张?我们在预测、归因和表征层面评估替代保真度。对于二元分类任务,对数赔率提供了模型表示空间的 API 兼容标量读数,而留一归因提供了对模型行为的洞察。在涵盖四个系列(Llama、Qwen、GPT 和 Gemini)的 11 个模型中,我们发现预测保真度大大夸大了归因保真度:对答案达成一致的模型通常不同意答案的原因。我们记录了访问有效性反转:注意模式和扰动幅度等白盒信号在模型中高度稳定,但对因果归因的预测能力很弱,而黑盒输入消融通过设计捕获了因果归因。机制洞察力不会自动转移到封闭的目标,并且预测级别的一致性不足以保证这种转移。代码和结果可在 https://github.com/facebookresearch/surrogate 获取。