论文
检测器自学:开放词汇目标检测的轻量级自监督适应
The Detector Teaches Itself: Lightweight Self-Supervised Adaptation for Open-Vocabulary Object Detection
摘要
开放词汇对象检测旨在从一组开放类别中识别对象,它利用在大规模图像文本数据上预先训练的视觉语言模型 (VLM)。协作范例将目标检测器与 VLM 相结合,以实现新目标的零样本识别。然而,在完整图像上预训练的 VLM 通常难以捕获局部对象细节,从而限制了其应用于区域级检测时的有效性。我们提出了解耦自适应训练 (DAT),这是一种自我监督的 微调 方法,用于改进基于协作模型的目标检测的 VLM。给定一个由闭集检测器和 VLM 组成的协作模型,我们首先使用预先训练的闭集对象检测器构建一个区域感知伪标记数据集,其中与新对象相对应的区域可能存在,但仍然未标记或错误标记。然后,我们以解耦的方式微调 VLM 的视觉主干,增强局部特征对齐,同时通过权重插值保留全局语义知识。 DAT 是一个即插即用模块,不需要推理开销,并且微调的参数少于 0.8M。 COCO 和 LVIS 数据集上的实验表明,DAT 持续提高了新类别和已知类别的检测性能,在合作开放词汇检测中建立了新的技术水平。