论文
VocaDet:通过视觉标记化和矢量数据库检索进行样本驱动的开放词汇对象检测和分割
VocaDet: Sample-Driven Open-Vocabulary Object Detection and Segmentation via Visual Tokenization and Vector Database Retrieval
摘要
开放词汇对象检测和分割旨在识别超出预定义类别的任意对象。尽管最近的视觉语言和基于参考的方法显着推进了这一领域,但它们通常依赖于文本提示、有限的视觉示例或昂贵的特征匹配程序,这使得它们难以扩展到大型且不断扩展的对象存储库。在这项工作中,我们提出了 VocaDet,一种样本驱动的开放词汇对象检测和分割框架,可以直接从用户提供的正样本和负样本集合中学习对象概念,而无需模型重新训练。关键思想是将连续的视觉表示转换为离散的视觉词汇,并通过可扩展的矢量数据库执行高效的基于检索的识别。具体来说,我们采用 DINOv3 作为视觉特征提取器,并应用具有自适应聚类敏感性的凝聚聚类来生成多粒度视觉标记。这些视觉标记与位置偏置表示和空间拓扑信息一起作为可扩展对象存储器存储在矢量数据库中。在推理过程中,查询图像被转换为视觉标记,并与存储的对象内存进行有效匹配,以进行对象定位和分割。此外,引入背景过滤机制来去除频繁出现的背景图案并减少实际固定相机场景中的冗余检索操作。在 UA-DETRAC 数据集上的实验表明,VocaDet 在无需传统检测器训练的情况下即可实现有效的开放词汇检测性能,同时支持随着额外正样本和负样本的积累而不断扩展的识别能力。