论文

DisParQ:视觉基础模型的自监督离散部件概念

DisParQ: Self-Supervised Part Concepts for Interpretable Vision Foundation Models

模型评测模型优化应用与实践模型压缩模型行为与机制分析视觉感知与空间理解

摘要

基于概念的视觉模型通过人类可检查概念的中间层来表示图像,因此模型所依赖的内容可以追溯到这些概念。然而,这些模型通常仅限于固定类别或依赖语言来定义其概念。我们引入了 DisParQ(具有量化属性的离散部分),这是一种从强大的冻结视觉自监督主干中学习空间基础的离散概念表示的方法。它不需要类别标签,也不需要语言监督。每个图像块都被分配给可学习原型字典中的一个概念,并且每个图像只有概念的稀疏子集可以激活。为了捕获每个概念在图像中的变化(例如“轮子”的类型),我们学习概念旁边的连续残差,然后将它们量化为离散属性。空间解码器仅根据概念和属性重建主干的表示,因此成功的重建意味着离散表示保留了主干的信息。我们评估 DisParQ 七个数据集,从一般识别(ImageNet、PartImageNet、Places)到细粒度基准(CUB、Cars、Dogs、Flowers)。我们表明,DisParQ 在 ImageNet 线性探测上与其冻结的 DINOv2 老师非常匹配(83.2% top-1),比语言对齐模型实现了更高的概念一致性,在细粒度识别上保持竞争力,并实现基于跨类别的部分检索。

DisParQ:视觉基础模型的自监督离散部件概念:论文原图
图 2:概念跨类别检索相同部分。查询区域(黑框)和具有最接近 DisParQ 概念描述的其他图像的四个区域(绿框)。