论文

ConEx:通过概念感知归因绘制人类可解释的显着性图

ConEx: Human-Interpretable Saliency Maps via Concept-Aware Attribution

模型评测模型行为与机制分析

摘要

计算机视觉中的许多视觉解释方法都强调像素的重要性,但很难将这些低级线索与语义上有意义的概念联系起来,限制了它们的可解释性和可信度。我们引入了基于概念的解释(ConEx),这是一种新颖的框架,它将显着性可视化与基于概念的推理联系起来,以提供忠实性和可解释性。 ConEx 自动发现特定于类的概念,并通过概念激活向量 (CAV) 表示它们,无需人工监督即可使用特定于架构的屏蔽机制进行学习,该机制可减少分段屏蔽引入的噪声,从而提高概念纯度。 ConEx 生成忠实的显着图,揭示每个概念在图像中出现的位置以及它如何对预测做出贡献。为了评估这些学习概念的可靠性,我们提出了两个互补的指标:向量概念匹配(VCM)和概念类匹配(CCM),它们可以量化概念对齐并能够与现有方法进行直接比较。跨不同设置的大量实验表明,ConEx 在忠实度、细分和概念质量基准方面实现了最先进的性能。总体而言,ConEx 推动了视觉模型领域真正可解释和基于概念的解释。

ConEx:通过概念感知归因绘制人类可解释的显着性图的原论文方法或结果图
图 2:ConEx 框架:(上)自动发现特定于类的概念和 CAV 构造。 (下)基于概念的显着性图的生成。