论文
CARE:通过师生蒸馏进行细粒度视觉分类的约束注意力细化
CARE: Constrained Attention Refinement for Fine-Grained Visual Classification via Teacher-Student Distillation
摘要
细粒度的视觉分类需要模型识别微妙的局部特征,同时揭示其预测背后的视觉证据。特定类别的注意力路径为可解释的识别提供了自然的基础,但其受限的预测结构限制了辨别能力,并且未充分利用来自强预训练主干的中间表示。为了解决这个问题,我们提出了 CARE,这是一种通过师生蒸馏进行可解释的细粒度识别的受限注意力细化框架。 CARE 将最终的预测和解释保留在特定于班级的注意力学生中,同时引入仅训练的辅助查询教师,该教师使用可学习的查询读取选定的中间 DINOv2 层。教师融合多层次表示,并将逻辑标准化的阶级歧视知识传递给学生。为了进一步完善解释路径,我们设计了多样性和稀疏性术语来规范学生的注意力头,减少冗余并鼓励紧凑的特征定位。 CUB上的实验, Oxford-IIIT Pet、Stanford Dogs 和Stanford Cars 表明,CARE 在可解释的冻结骨干设置下实现了强大的分类性能,在 CUB 上达到了 78.5% 的 Top-1 准确率。使用插入和删除指标的忠实度分析进一步表明,排名靠前的注意力区域保留了与类别相关的解释证据。