论文

VL-DINO:利用 CLIP 视觉语言知识进行开放词汇目标检测

VL-DINO: Leveraging CLIP Vision-Language Knowledge for Open-Vocabulary Object Detectio

摘要

像 CLIP 这样的视觉语言模型可以为开放词汇对象检测提供丰富的语义先验。然而,将文本和视觉知识联合集成到检测架构中仍然具有挑战性。在本文中,我们提出了 VL-DINO,一种开放词汇检测器,通过更有效地利用 CLIP 的视觉语言知识来增强 DINO。具体来说,首先开发了查询引导的正样本构建(QPSC)模块来构建额外的高质量正样本,使普通的DINO框架能够更好地适应跨异构数据源的混合训练,同时提供更多的视觉语言对齐信号,从而在训练过程中融入更丰富的文本知识。然后引入视觉语义编码器 (VSE) 模块,将 CLIP 视觉知识提炼为主干提取的特征,为后续编码器细化生成融合特征。基于融合的特征,对象区域语义对齐(ORSA)模块提取以对象为中心的区域特征,并将它们与相应的文本嵌入对齐,进一步合并文本提示。在零样本设置中,VL-DINO-T 和 VL-DINO-L 在 LVIS 基准上分别达到 36.3 和 38.1 AP,始终优于先前的先进方法。大量的实验证明了所提出的设计的有效性和竞争性能。