论文

揭开未知的面纱:使用场景图进行开放词汇对象检测

Unveiling the Unknown: Open Vocabulary Object Detection with Scene Graphs

应用与实践视觉感知与空间理解

摘要

开放词汇对象检测旨在识别不属于训练数据的新对象类别。许多基于 知识蒸馏 的方法通过将知识从预训练的视觉语言模型转移到对象检测而显示出良好的性能。然而,这些方法常常忽视对象之间结构化的、特定于图像的关系,例如交互和空间布置。这种疏忽会严重限制检测新类别的有效性。为了解决这个问题,我们提出了场景引导关系建模检测框架。该框架利用场景图来捕获候选区域及其上下文对象之间的结构化语义和空间关系。它明确地模拟了相邻区域之间的交互,并结合了关系注意模块来隐式放大从场景图中提取的关键关系线索。此外,我们提出了一个基于场景的文本对齐分支,它从图像描述中提取类别知识来指导关系对齐。这种方法有助于视觉关系与语义信息的无缝集成,以增强检测性能。综合实验表明,与其他 OVOD 方法相比,我们的模型实现了卓越的性能,提高了 COCO 和 LVIS 数据集上新类别的 AP。