论文
用于细粒度图像检索的区域感知 CLS token增强
Region-Aware CLS Token Augmentation for Fine-Grained Image Retrieval
摘要
图像检索方法通常依赖于从图像中提取的单个全局语义描述符,例如视觉Transformer中的 [CLS] 标记。然而,尝试将图像的所有语义信息压缩到单个描述符中可能会损害下游检索性能,尤其是对于细粒度检索任务。在这项工作中,我们使用精心选择的空间标记集合来增强较新的视觉Transformer、全局 [CLS] 标记和四个寄存器标记中的语义标记,旨在捕获表征每个语义标记中捕获的内容的空间区域表示。我们利用 DINOv2-reg 模型,其中包括可以紧急学习基于对象和部分的表示的注册token。对于每个“cue”标记([CLS] 和每个寄存器标记),我们找到一个“buddy”图像补丁标记并提取 N x N 补丁区域以生成一组本地化 ROI 标记。我们的方法自动捕获重要的感兴趣区域,无需任何外部边界框或显着性模块,纯粹通过将语义标记与其匹配 空间表示区域。此外,我们将这些token合并到受 ColBERT 启发的多向量检索框架中,通过每个token对齐机制实现细粒度匹配,同时避免保留所有补丁嵌入的大量存储成本。通过大量的实验,我们发现(1)寄存器token编码有用的细粒度细节,可以补充[CLS]token; (2)自动池化ROItoken进一步提高细粒度区分度; (3) 使用一小组标记的多向量检索比 DINOv2-reg 单向量基线有所改进,同时保持大规模搜索的易处理性。该代码可在https://github.com/IdhcbIan/Augmenting_CLS_with_ROI_tokens. 获取