论文
具有查询驱动场景图的可解释零样本引用表达式理解
Interpretable Zero-shot Referring Expression Comprehension with Query-driven Scene Graphs
摘要
零样本引用表达理解(REC)旨在在给定自然语言查询的情况下定位图像中的目标对象,而不依赖于特定任务的训练数据,需要强大的视觉理解能力。现有的视觉语言模型(VLM),例如 CLIP,通常通过直接测量文本查询和图像区域之间的特征相似性来解决零样本 REC。然而,这些方法很难捕捉细粒度的视觉细节并理解复杂的对象关系。同时,大语言模型~(LLM)擅长高级语义推理,它们无法直接将视觉特征抽象为文本语义,限制了它们在REC任务中的应用。为了克服这些限制,我们提出了 \textbf{SGREC},这是一种可解释的零样本 REC 方法,利用查询驱动的场景图作为结构化中介。具体来说,我们首先使用 VLM 构建查询驱动的场景图,该场景图显式编码与给定查询相关的空间关系、描述性文本和对象交互。通过利用这个场景图,我们弥合了底层图像区域和 LLM 所需的高级语义理解之间的差距。最后,LLM 从场景图提供的结构化文本表示中推断出目标对象,并对其决策进行详细解释,以确保推理过程中的可解释性。大量实验表明,SGREC 在大多数零样本 REC 基准测试中均达到了 top-1 的准确率,包括 RefCOCO val (66.78\%)、RefCOCO+ testB (53.43\%) 和 RefCOCOg val (73.28\%),凸显了其强大的视觉场景理解能力。