论文
基于扩散模型的概念级视觉反事实解释
Concept-based Visual Counterfactual Explanations with Diffusion Models
摘要
视觉反事实解释旨在回答"对这张图像做何种最小改变会翻转模型的预测?",随着视觉模型被部署到安全关键领域(如医学),其重要性日益上升。现有基于扩散的方法能生成逼真的编辑,但它们依赖必须在噪声图像上可靠工作的外部分类器,这使其脆弱且难以部署以提供稳健解释。我们提出 C-VCE,一个新型扩散框架,通过概念瓶颈层将分类器直接构建到生成模型中,使反事实由人类可解释的特征(概念)引导,而非依赖一个在像素级编辑上工作的独立抗噪分类器。我们的模型允许用户在采样过程中开关语义概念,随后最小限度地调整相关图像区域,同时尊重特征相关性并保留图像其余部分。为使编辑保持小幅且可控,我们添加了一个简单的概率正则化器来平衡"改变预测"与"贴近原图",并辅以基于梯度的掩码将修改限定在最相关的区域。在 CelebA 等基准上,C-VCE 匹敌或提升了翻转率,同时产生的反事实在视觉上更接近输入,且比依赖独立噪声图像分类器的基线失真更小。这些特性使 C-VCE 成为视觉系统的实用工具:用户需要具体的"假设"图像,却不必信任一个额外的抗噪分类器。更广泛地说,我们的结果表明,暴露并控制内部概念层是让强大生成模型更易理解、更安全使用的一条有前景的路径。
