论文

通过概念解释 CLIP 零样本预测

Explaining CLIP Zero-shot Predictions Through Concepts

模型评测模型行为与机制分析

摘要

CLIP 等大规模视觉语言模型在零样本图像识别方面取得了显着的成功,但它们的预测在很大程度上对人类理解来说仍然不透明。相比之下,概念瓶颈模型通过人类定义的概念进行推理,提供可解释的中间表示,但它们依赖于概念监督,缺乏泛化到看不见的类的能力。我们引入 EZPC,通过人类可理解的概念解释 CLIP 的零样本预测,从而连接这两种范式。我们的方法将 CLIP 的联合图像-文本嵌入投影到从语言描述中学习的概念空间中,从而无需额外的监督即可实现忠实且透明的解释。该模型通过对齐和重建目标的组合来学习这种投影,确保概念激活保留 CLIP 的语义结构,同时保持可解释性。对五个基准数据集(CIFAR-100、CUB-200-2011、Places365、ImageNet-100 和 ImageNet-1k)的广泛实验表明,我们的方法保持了 CLIP 强大的零样本分类精度,同时提供有意义的概念级解释。通过将开放词汇预测建立在显式语义概念的基础上,我们的方法为实现可解释且值得信赖的视觉语言模型迈出了原则性的一步。代码可在 https://github.com/oonat/ezpc 获取。