论文

LIG:Transformer 中层内流动分析的分层积分梯度

LIG: Layer-wise Integrated Gradients for Within-Layer Flow Analysis in Transformers

模型评测模型行为与机制分析

摘要

Transformer 实现了强大的性能,但其内部计算仍然不透明。我们将每个 Transformer 层视为一个动态图,其节点是词元表示和每头注意力输出,以多头注意力(ATT)和 MLP 作为模块边界。在此图中,我们使用 LIG(逐层积分梯度),它在非线性模块边界应用组对集积分梯度 (IG)。 Set-to-set IG 将 IG 应用到从一组输入标记表示到一组输出表示的映射,评估标记到标记的贡献,这在之前的 IG 应用中不是标准的。这通过 L2 标量化将 IG 从通常的标量目标设置扩展到集合到集合映射,并本着逐层相关性传播 (LRP) 的精神组成层内贡献,IG 完整性在每个边界上发挥 LRP 式守恒的作用。我们使用 LIG 来分析 (i) L2 标准下按模块组合和层整体归因之间的一致性,以及 (ii) 通过跟踪单独的 ATT 和 MLP 贡献来分析层内信息流。在 BERT-base 和 PTB 上,最好地保持层内一致性的配置使用目标词元的嵌入作为 ATT 基线,并将 a=0 或零处的 ATT 输出作为 MLP 基线。因此,我们将 LIG 作为模块边界粒度的诊断 XAI 工具,无需特定于模型的重新训练或每个操作解释器设计。代码可在 https://github.com/eightsuzuki/layer-wise-integrated-gradients 获取。