论文

用于细粒度分类的 CLIP 引导无标签判别区域评分

CLIP-Guided Label-Free Discriminative Region Scoring for Fine-Grained Classification

模型评测评测方法与指标

摘要

最近的视觉模型(例如 CLIP 和 SAM)支持 无需训练 分割和语义编码,以实现细粒度分类。一种常见的方法是将分割图像区域的表示与相应标签的文本提示嵌入进行比较。然而,目前尚不清楚不同的局部区域和基于 CLIP 的评分策略如何影响歧视性证据的选择,特别是当 真值 标签不可用时。在本文中,我们提出了一个统一的 CLIP 引导的无标签区域评分框架,用于细粒度分类。该框架使用 SAM 生成的掩模和随机裁剪来评估基于余弦相似度、基于边缘和基于熵的评分策略,并引入两种基于全局图像嵌入和局部区域嵌入的无标签伪标签变体。我们在五个细粒度分类数据集上进行实验,系统地比较不同的区域生成方法和评分策略。结果表明,Soft Negative Margin 评分实现了最强的性能,并且伪标签评分非常接近真标签性能。尽管 SAM 生成语义上有意义的掩码,但在所有数据集中,基于随机裁剪的伪标签评分始终优于基于 SAM 的评分,这表明随机裁剪可以保留周围信息,并在伪标签有噪声时提供更稳定的语义上下文。此外,SAM 掩码受益于聚合所有区域的嵌入,而随机裁剪往往在较小的 top-k 子集下表现更好。这些发现为细粒度分类提供了新的见解。