论文

面向视觉基础模型的快速且清晰的反事实

Towards Fast and Disentangled Counterfactuals for Visual Foundation Models

模型评测模型行为与机制分析

摘要

基金会模型仍然容易受到虚假相关性和“聪明的汉斯”策略的影响。可解释的机器学习可以在没有元数据的情况下找到并删除此类分类器策略。对于基础模型,尚不存在这样的选项。我们提出解缠结扩散自动编码器(DiDAE)。 DiDAE 将冻结的基础模型包装在条件扩散解码器中。反事实是沿着解开的字典的方向进行的封闭式编辑,然后进行解码。该字典可以是有监督的(Procrustes)或无监督的(奇异值分解,稀疏自动编码器)。不需要梯度,因此 DiDAE 比现有技术快 2000 倍。我们对六个数据集进行评估,其中两个是合成数据集,四个是真实世界数据集。在其中三个的需求驱动基准中,其反事实与最先进的水平相当或更好,并且它们通过反事实知识蒸馏(CFKD)修复下游分类器,其中它们击败了基于元数据的校正。相同的机器可以根据训练好的分类器对预训练的字典进行排名。它返回分类器实际读取的几个方向,每个方向都通过翻转决策的反事实进行因果验证,并沿着老师标记为虚假的方向修复分类器。该工作流程在我们与论文一起发布的开源 Peal 库中是即插即用的。有了公共字典和预训练的解码器,剩下的就是分类器的廉价线性蒸馏及其自身的微调。