论文

ReLIC-SGG:用关系格补全缓解场景图标注缺失

ReLIC-SGG: Relation Lattice Completion for Open-Vocabulary Scene Graph Generation

应用与实践视觉感知与空间理解

摘要

开放词汇场景图生成(SGG)旨在使用超出固定谓词集的灵活关系短语来描述视觉场景。现有方法通常将带注释的三元组视为正例,将所有未注释的对象对关系视为负例。然而,场景图注释本质上是不完整的:缺少许多有效的关系,并且可以以不同的粒度描述相同的交互,例如 \textit{on}、\textit{stand on}、\textit{resting on} 和 \textit{supported by}。由于关系空间更大,这个问题在开放词汇 SGG 中变得更加严重。我们提出 \textbf{ReLIC-SGG},一个关系不完整性感知框架,它将未注释​​的关系视为潜在变量而不是明确的负例。 ReLIC-SGG 构建了一个语义关系格来对开放词汇谓词之间的相似性、蕴涵和矛盾进行建模,并使用它从视觉语言兼容性、图结构上下文和语义一致性中推断缺失的正关系。正例—未标注图学习目标进一步减少了假负监督,而格引导解码则产生紧凑且语义一致的场景图。在传统、开放词汇和全景 SGG 基准上的实验表明,ReLIC-SGG 提高了罕见和未见过的谓词识别,并更好地恢复丢失的关系。