论文
从局部到全局再到机械:以 iERF 为中心的解释视觉模型的统一框架
From Local to Global to Mechanistic: An iERF-Centered Unified Framework for Interpreting Vision Models
摘要
现代视觉模型取得了显着的准确性,但解释证据出现的位置、模型编码的内容以及内部计算如何组装证据仍然支离破碎。我们引入了一个以 iERF 为中心的框架,它围绕单个分析单元统一了局部、全局和机械可解释性:点状特征向量 (PFV) 与其特定于实例的有效感受野 (iERF) 配对。在本地侧,共享比率分解(SRD)通过共享比率将每个 PFV 表示为上游 PFV 的混合,并传播 iERF 以构建类判别显着性图。 SRD 产生高分辨率、激活忠实的解释,对目标操作和噪声具有鲁棒性,并且在常见的非线性中保持激活不可知。对于全局视图,我们引入了概念锚定特征解释(CAFE),它利用 iERF 作为语义标签,将抽象潜在向量建立在可验证的像素级证据中。通过 CAFE,我们解决了非局部稀疏自动编码器潜在问题的挑战,特别是在 Transformer 中,其中早期的自注意力混合了遥远的上下文。为了回答如何通过深度组成表示,我们提出了具有层间概念归因的层间概念图(ICAT),它在隔离层对的同时量化概念到概念的影响;层间插入、删除协议将集成梯度视为最忠实的实例。根据经验,在 ResNet50、VGG16 和 ViT 中,我们的框架在保真度和鲁棒性方面均优于基线,成功解释了分散的 SAE 特征,并在正确、错误分类和对抗性案例中揭示了主导概念路线。我们的方法以 iERF 为基础,提供了从像素到概念再到决策的连贯的、有证据支持的地图。