论文

通过视觉语言模型的上下文推理进行个性化对象识别和定位

Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models

应用与实践视觉感知与空间理解

摘要

个性化对象定位 (POL) 基于一些带有边界框注释和目标对象标签的参考图像来定位查询图像中的对象实例。开创性的方法 IPLo 通过视觉语言模型 (VLM) 的上下文推理来解决此任务。但是,它假设查询图像始终包含目标对象。这种假设严重限制了其对具有许多不相关图像的现实场景的适用性。为了解决这个问题,我们通过将 POL 定位在更广泛的少样本目标检测框架内,制定了一项新任务:个性化目标识别和定位 (POIL)。 POIL 旨在本地化目标对象实例,同时拒绝不包含参考对象实例的查询图像。我们还提供了从公共来源构建的 POIL 数据集。我们进一步提出了一种名为 IPLoc-ID 的上下文内算法,用于使用 VLM 求解 POIL。 IPLoc-ID首先预测候选边界框,然后确定其是否对应于参考对象实例。我们引入了一个自提出查询来在单个自回归生成框架中连接这两个步骤。通过消融研究和综合实验,我们表明 IPLoc-ID 显着抑制了对负查询图像的误报检测,同时保持了与 IPLoc 相当的定位性能。总体而言,IPLoc-ID 有效地解决了实际的实例级 POIL 任务,而传统的目标检测、少样本目标检测或仅定位 IPLoc 方法无法充分解决该任务。