论文

跨层转码器可以取代 Vision Transformer 激活吗?视觉的可解释视角

Can Cross-Layer Transcoders Replace Vision Transformer Activations? An Interpretable Perspective on Vision

模型评测模型行为与机制分析

摘要

了解 Vision Transformer (ViTs) 的内部激活对于构建可解释且值得信赖的模型至关重要。虽然稀疏自动编码器(SAE)已被用来提取人类可解释的特征,但它们在各个层上运行,无法捕获 Transformer 的跨层计算结构,以及每个层在形成最后一层表示中的相对重要性。或者,我们引入跨层转码器 (CLT) 作为 ViT 中 MLP 块的可靠、稀疏和深度感知的代理模型。 CLT 使用编码器-解码器方案根据先前层的学习稀疏嵌入来重建每个后 MLP 激活,从而产生线性分解,将 ViT 的最终表示从不透明嵌入转换为可加的、层解析的结构,从而实现忠实的归因和过程级可解释性。我们在 CLIP ViT-B/32 和 ViT-B/16 上跨 CIFAR-100、COCO 和 ImageNet-100 训练 CLT。我们表明,CLT 通过 MLP 后激活实现了高重建保真度,同时在某些情况下保留甚至提高了 CLIP 零样本分类精度。在可解释性方面,我们表明跨层贡献分数提供了忠实的归因,揭示了最终表示集中在较小的一组主要分层术语中,这些术语的删除会降低性能,而其保留在很大程度上会保留性能。这些结果展示了采用 CLT 作为视觉领域 ViT 的替代可解释代理的重要性。