论文

从权重到概念:通过奇异向量分解实现 CLIP 的无数据可解释性

From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

模型评测模型行为与机制分析

摘要

随着视觉语言模型的大规模部署,理解其内部机制变得越来越重要。现有的可解释性方法主要依赖于激活,这使得它们依赖于数据集,容易受到数据偏差的影响,并且通常仅限于粗略的头级解释。我们引入 SITH(Transformer 头的语义检查),这是一个完全无数据的 无需训练 框架,可直接分析 CLIP 在权重空间中的愿景 Transformer。对于每个注意力头,我们将其值输出矩阵分解为奇异向量,并通过 COMP(相干正交匹配追踪)解释每个向量,这是一种新算法,将它们解释为人类可解释概念的稀疏、语义连贯的组合。我们证明 SITH 可以产生连贯、忠实的脑内解释,并通过重建保真度和可解释性实验进行验证。这使我们能够使用 SITH 进行精确、可解释的权重空间模型编辑,从而放大或抑制特定概念,从而无需重新训练即可提高下游性能。此外,我们使用 SITH 来研究模型自适应,展示 微调 如何主要重新加权稳定的语义基础,而不是学习全新的特征。