论文

基于扩散模型的概念级视觉反事实解释

Concept-based Visual Counterfactual Explanations with Diffusion Models

模型推理解码与生成控制

摘要

视觉反事实解释旨在回答"对这张图像做何种最小改变会翻转模型的预测?",随着视觉模型被部署到安全关键领域(如医学),其重要性日益上升。现有基于扩散的方法能生成逼真的编辑,但它们依赖必须在噪声图像上可靠工作的外部分类器,这使其脆弱且难以部署以提供稳健解释。我们提出 C-VCE,一个新型扩散框架,通过概念瓶颈层将分类器直接构建到生成模型中,使反事实由人类可解释的特征(概念)引导,而非依赖一个在像素级编辑上工作的独立抗噪分类器。我们的模型允许用户在采样过程中开关语义概念,随后最小限度地调整相关图像区域,同时尊重特征相关性并保留图像其余部分。为使编辑保持小幅且可控,我们添加了一个简单的概率正则化器来平衡"改变预测"与"贴近原图",并辅以基于梯度的掩码将修改限定在最相关的区域。在 CelebA 等基准上,C-VCE 匹敌或提升了翻转率,同时产生的反事实在视觉上更接近输入,且比依赖独立噪声图像分类器的基线失真更小。这些特性使 C-VCE 成为视觉系统的实用工具:用户需要具体的"假设"图像,却不必信任一个额外的抗噪分类器。更广泛地说,我们的结果表明,暴露并控制内部概念层是让强大生成模型更易理解、更安全使用的一条有前景的路径。

基于扩散模型的概念级视觉反事实解释:论文配图
图 1:C-VCE 框架概述。该过程首先将原始图像编码到潜在空间中。在潜在扩散阶段,配备 CBM 的 U-Net 执行引导去噪。概念干预模块允许有针对性的属性转变(例如,微笑0→10\至1)。同时,该框架估计干净样本以通过外部分类器计算梯度,从而创建动态梯度导出掩模。最后,将噪声预测和掩模相结合,对前一个时间步骤进行迭代采样,直到达到干净的潜在反事实,然后将其解码回像素空间。