论文
细粒度概念瓶颈模型的概念关注
Concept-wise Attention for Fine-grained Concept Bottleneck Models
摘要
最近,通过利用大型预训练视觉语言模型(即 CLIP)学习的图像文本对齐,概念瓶颈模型(CBM)取得了令人印象深刻的性能。然而,概念建模存在两个关键限制。现有方法经常遭受 预训练 偏差,表现为粒度错位或对结构先验的依赖。此外,具有二元交叉熵(BCE)损失的 微调 独立处理每个概念,忽略了概念之间的相互排斥性,导致次优对齐。为了解决这些限制,我们提出了细粒度概念瓶颈模型的概念明智关注(CoAt-CBM),这是一种实现自适应细粒度图像概念对齐和高可解释性的新颖框架。具体来说,CoAt-CBM 采用可学习的概念明智的视觉查询来自适应地获得细粒度的概念明智的视觉嵌入,然后将其用于生成概念得分向量。然后,一种新颖的概念对比优化指导模型处理概念分数的相对重要性,使概念预测能够忠实地反映图像内容并改进对齐。大量实验表明,CoAt-CBM 的性能始终优于最先进的方法。代码将在接受后可用。