论文
DINO-QPM:采用视觉基础模型进行全局可解释的图像分类
DINO-QPM: Adapting Visual Foundation Models for Globally Interpretable Image Classification
摘要
尽管像 DINOv2 这样的视觉基础模型作为特征提取器提供了最先进的性能,但它们复杂的高维表示为可解释性带来了巨大的障碍。这项工作提出了 DINO-QPM,它将这些强大但纠缠的特征转换为人类可以解释的对比的、与类无关的表示。 DINO-QPM 是一种轻量级可解释性适配器,追求全局可解释图像分类,采用二次规划增强模型 (QPM) 在严格冻结的 DINO 主干上运行。虽然视觉基础模型的分类通常依赖于 \texttt{CLS} 标记,但我们故意偏离此标准。通过利用平均池,我们将补丁嵌入直接连接到模型的特征,从而实现 DINO-QPM 的全局可解释特征在输入空间内的空间定位。此外,我们应用稀疏损失来最小化空间散射和背景噪声,确保解释基于相关的对象部分。借助 DINO-QPM,我们使 QPM 的可解释性水平可用作适配器,同时超过 DINOv2 线性探头的精度。通过引入的合理性指标和其他可解释性指标进行评估,大量实验表明,DINO-QPM 在分类准确性和解释质量方面均优于其他适用于冻结视觉基础模型的方法。