论文

归因一直下降?可解释性的元游戏

Attributions All the Way Down? The Metagame of Interpretability

模型评测模型行为与机制分析

摘要

我们引入了元游戏,一个用于量化模型解释的二阶交互效应的概念框架。对于解释模型$f$的任何一阶归因$φ(f)$,我们通过将归因方法本身视为合作博弈并计算其Shapley值来测量特征$j$对特征$i$的归因的方向影响,表示为元归因$\varphi_{j \to i}(f)$。从理论上讲,我们证明归因可以分层分解为元归因,并将它们建立为现有交互指数的定向扩展。根据经验,我们证明元游戏提供了跨不同可解释性应用的见解:(i)量化指令调整语言模型中的标记交互,(ii)解释视觉语言编码器中的跨模态相似性,以及(iii)解释多模态扩散 Transformer 中的文本到图像概念。