论文
视觉思维内部:用于解释和引导视觉的神经科学驱动的概念电路 Transformer
Inside the Visual Mind: Neuroscience-Motivated Concept Circuits for Interpreting and Steering Vision Transformers
摘要
尽管准确度很高,但 Vision Transformer (ViT) 预测可能会受到虚假线索的驱动,因此需要在安全部署之前了解其内部工作原理。稀疏自动编码器 (SAE) 为将模型表示分解为人类可解释的概念提供了一个有前途的镜头,但由于对概念覆盖范围和主观、不可扩展的特征解释的控制有限,将基于 SAE 的解释适应 ViT 仍然具有挑战性。为了填补这一空白,在神经科学启发原理的推动下,我们提出了 ViSAE,这是一个机械可解释性工具箱,用于通过概念电路理解 ViT 内部工作原理。 ViSAE 由三个组件组成:(1) 具有 64K 图像和 16K 视觉基础概念词汇的探测套件,概念覆盖效率比 ImageNet 提高 20 倍,解释精度比现有概念集提高 28.7%。 (2) 自上而下的概念读取和自下而上的电路追踪算法,通过概念电路自动恢复 ViT 内部工作原理。 (3) 用于审计和指导 ViT 行为的应用程序。通过概念编辑,ViSAE 将 WaterBirds 的最差组准确率提高了 48.2%,比现有方法高出 23.8%。我们的数据和代码:https://github.com/deep-real/ViSAE。