论文
对比视觉语言模型的有针对性的视觉反事实解释
Targeted Visual Counterfactual Explanations for Contrastive Vision-Language Model
摘要
当前对比视觉语言模型(例如 CLIP)的解释方法主要识别重要区域,而没有展示如何更改输入以获得目标预测。我们引入了掩模引导的自适应反事实解释(MACE),这是一种专门为 CLIP 零样本分类设计的有针对性的视觉反事实方法。 MACE 根据源归因或源-目标归因差异构建可编辑区域,并仅在需要达到指定目标类时扩展掩码。然后,潜在扩散修复模型会修改所选区域,而冻结的 CLIP 模型则提供修改指导并将剩余图像内容锚定到原始输入。我们在 ImageNet、Food-101、Oxford Pets 和 CUB-200 上评估 MACE。源掩模变体在所有四个数据集上实现了最高的目标 top-1 成功率,而差异掩模变体产生最小的像素级别和感知变化以及最佳的真实感分数。两种变体都使用相同的生成主干,在仅稳定扩散的基线上提高了接近度和真实感。这些结果表明,自适应蒙版引导编辑可产生有效的 CLIP 反事实。他们进一步揭示了反事实有效性和源图像保存之间的权衡。