论文

无需权衡的可解释性:在同等预测性能下解开多语义性

Interpretability Without Tradeoffs: Disentangling Polysemanticity At Equal Predictive Performance

模型评测模型行为与机制分析

摘要

深度神经网络 (DNN) 被广泛使用,但解释它们实际学到的内容仍然很困难。一个主要障碍是单个神经元经常编码多个不相关的概念,从而模糊了网络的决策过程。虽然先前的工作(例如稀疏自动编码器)可以将这些混合信号分离为更有意义的“单语义”特征,但这通常需要以可能降低下游性能的方式改变模型。为了克服这个问题,我们引入了 ELUDe(显式、无损、无监督解缠),这是一种提高 DNN 可解释性同时保持其功能等效性的方法。 ELUDe 将潜在表示分解为清晰、可检查的子单元,其行为类似于可解释的特征,同时保证模型的输出保持完全相同。它不需要显式训练,不需要标签,并且可以应用于预训练模型。 ELUDe 的工作原理是重新组织信息在层之间流动的方式,重新路由特定于概念的贡献,同时通过构造保留原始计算。在包括 DINOv2 和监督 ViT-B/16 在内的多种视觉模型中,ELUDe 提高了可解释性,保持下游精度不变,高效运行,并支持转向模型表示等实际用途。简而言之,ELUDe(几乎)无需权衡即可提供可解释性:更清晰、可扩展且可操作的模型见解,且不会损失性能。