论文

重量中的“世界知识”:阅读视觉概念电路Transformer

"World Knowledge" in the Weights: Reading Concept Circuits of Vision Transformers

模型评测模型行为与机制分析

摘要

视觉 Transformer (ViTs) 在视觉领域取得了显着的泛化,但人们对它们内部如何表示世界结构知之甚少。为了解决这个问题,我们使用跨层转码器(CLT)从 ViT 中读取概念电路:有向图,其节点对应于稀疏的、可解释的概念,边捕获跨层的概念交互。我们的方法产生了模型行为的两种互补视图。全局概念电路是输入不变的,可以直接从学习的跨层权重中恢复,公开模型中编码的可重用的“世界知识”。实例概念电路依赖于输入,并识别实际用于特定预测的概念和路径,从而实现忠实的示例级解释。我们通过三种方式展示了概念电路的实用性:(1)自动虚假相关性发现:利用我们的全局概念电路的统计数据来识别模型内的快捷依赖关系。 (2)虚假相关性去除:干预实例概念电路以引导模型做出正确的预测。实证结果表明,我们的方法在 Waterbird 数据集上的性能比现有方法高出 11.0%。 (3)模型比较:对比不同基础模型(例如CLIP与DINO)的全局概念回路,以揭示监督范式如何塑造表征结构。我们的代码位于 https://github.com/deep-real/VisionCLT