论文

CAGE-SGG:用于开放词汇场景图生成的反事实活动图证据

CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation

应用与实践视觉感知与空间理解

摘要

开放词汇场景图生成(SGG)旨在使用超出固定谓词词汇的灵活且细粒度的关系短语来描述视觉场景。虽然最近的视觉语言模型极大地扩展了 SGG 的语义覆盖范围,但它们也引入了一个关键的可靠性问题:预测关系可能是由语言先验或对象共现而不是基于视觉证据驱动的。在本文中,我们提出了一种基于反事实关系验证的证据全面的开放词汇SGG框架。我们的方法不是直接接受合理的关系建议,而是验证每个候选关系是否得到特定于关系的视觉、几何和上下文证据的支持。具体来说,我们首先使用视觉语言提议者生成开放词汇关系候选者,然后将谓词短语分解为软证据基础,例如支持、联系、包含、深度和状态。关系条件证据编码器提取与谓词相关的线索,而反事实验证器则测试当必要的证据被删除时关系分数是否会下降,并在不相关的扰动下保持稳定。我们进一步引入矛盾感知谓词学习和图级偏好优化,以提高细粒度辨别和全局图一致性。对传统、开放词汇和全景 SGG 基准的实验表明,我们的方法持续改进了基于标准召回的指标、未见谓词泛化和反事实基础质量。这些结果表明,从关系生成转向关系验证会产生更可靠、可解释且基于证据的场景图。