论文
VL-SAM-v3:用于开放世界对象检测的记忆引导视觉先验
VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection
摘要
开放世界对象检测旨在定位和识别固定封闭集标签空间之外的对象。它通常分为两类,即开放词汇检测(在测试时假设预定义的类别列表)和开放式检测(需要在推理过程中生成候选类别)。现有的方法主要依赖于粗略的文本语义和参数知识,这通常无法为细粒度的外观变化、稀有类别和杂乱的场景提供足够的视觉证据。在本文中,我们提出了 VL-SAM-v3,这是一个统一的框架,可以通过基于检索的外部视觉记忆来增强开放世界检测。具体来说,一旦候选类别可用,VL-SAM-v3就会从非参数存储库中检索相关的视觉原型,并将它们转换为两个互补的视觉先验,即用于实例级空间锚定的稀疏先验和用于类感知局部上下文的密集先验。这些先验通过记忆引导提示细化与原始检测提示集成,从而实现支持开放词汇和开放式推理的共享检索和细化机制。 LVIS 上的大量零样本实验表明,VL-SAM-v3 在开放词汇和开放式推理下持续提高检测性能,尤其是在稀有类别上取得了显着的进步。此外,使用更强的开放词汇检测器(即 SAM3)进行的实验验证了所提出的检索和细化机制的通用性。