论文
ResLRP:残差消除在视觉 Transformer 中归因不稳定性中的作用
ResLRP: The Role of Residual Cancellation in Attribution Instability in Vision Transformers
摘要
视觉变换器 (ViT) 是大多数现代视觉模型的核心,但获得细粒度、忠实且稳定的输入属性仍然具有挑战性。逐层相关性传播(LRP)已适应Transformer注意力,但在 ViT 中它经常产生嘈杂的、不忠实的解释。我们表明,缺失的成分是对残余连接的处理:残余路径中的取消效应导致归因爆炸。此外,我们发现 ViT 中的这些取消比语言转换器中的取消要强得多。为了解决这个问题,我们引入了残差感知逐层相关性传播(ResLRP),这是 LRP 的简单扩展,其传播规则明确地考虑了残差分支中的取消,并且是完全保守的,并且可证明绑定相关性爆炸。因果通道干预证实,导致不稳定的是残余抵消,而不是一般的正则化效应。 ResLRP 显着提高了忠实度和本地化方面的归因质量,并在跨越监督、自监督、对比、分层和多模态系列的 ViT 架构以及真值可控的FunnyBirds 基准上进行了评估。最大的进步出现在现代视觉语言模型 (VLM) 中,本地化程度提高了 27-29%,忠实度分数提高了 3.4 倍。除了基准之外,ResLRP 在输入空间中定位稀疏自动编码器 (SAE) 特征,并且我们的残差放大测量可用作架构级诊断,预测归因退化的位置。