论文

每个组件都是一个查找:一个用于交互、组合和归因的线性图

Every Component Is a Lookup: One Linear Graph for Interaction, Composition and Attribution

模型评测模型行为与机制分析

摘要

Transformer 的可解释性方法通常围绕单独的问题构建:哪些组件交互、信息如何路由到输出以及哪些输入标记起作用。由于这些方法依赖于不同的假设,因此它们的答案很难关联。我们认为,两个基于架构的假设足以解决所有三个问题:注意力和 MLP 共享一个键值形式 $φ(S)\,U$,其中 $φ(S)$ 选择值 $U$,并且组件从附加残差流(组件输出的总和)中读取。将这些选择保持在其前向传递值,会将模型转变为计算图,其中组件交互、组合路径和标记属性是不同的读数。我们在此图上开发了 Unpack(一种后向归因程序),并根据相应的既定测试验证每个读数:交互分数预测从 160M 到 6.9B 参数的模型的消融效果,恢复的路线将已建立的电路复制到电路指定的键、查询或值分支,并且词元归因通过与专用归因方法相同的 忠实性 测试。结果表明这两个假设足以解决上述可解释性问题。在具有已知电路的任务中,我们发现贡献和因果效应可能有所不同,并且这种差异具有可识别的特征:当从输入中删除任务时,对任务重要的组件会改变其贡献,而充当偏置项的组件则不会。代码可在 https://github.com/Fun-Cry/unpacklm 获取。