论文

OvDSGG:端到端开放词汇动态场景图生成

OvDSGG: End-to-End Open-Vocabulary Dynamic Scene Graph Generation

应用与实践视觉感知与空间理解

摘要

动态场景图 (DSG) 将视频之间的时空交互捕获为 $\langle$主语、谓语、宾语$\rangle$ 三元组,并支持视频字幕、视频问答和动作分析等下游任务。然而,端到端动态场景图生成(DSGG)方法是封闭集的:它们仅识别固定训练词汇中的对象和谓词,并与稀有概念的长尾分布作斗争,严重限制了它们在现实世界中的适用性。现有的开放词汇模型通常继承预训练的大语言模型,导致多阶段训练和推理,成本高昂。我们介绍 OvDSGG,这是第一个开放词汇 DSGG 的端到端框架。 OvDSGG 建立在开放词汇空间骨干和时间骨干之上;我们进一步提出了一个桥接它们的三元组特征提取模块,以及一个视觉语言对齐模块,该模块通过学习联合视觉语言特征空间中的自适应决策边界来保留开放词汇识别,而无需现有方法中昂贵的 知识蒸馏。我们进一步引入了一个严格的开放词汇 DSGG 基准,改编自 Action Genome,对对象和谓词都有不相交的 Base/Novel 分割。 OvDSGG 在所有指标上都显着优于开放词汇基线,零样本召回@$K$ 得分比次佳基线高 10.0--20.4 个百分点,而在封闭集 DSGG 上仍与最先进的模型保持竞争力。代码和基准可在 https://github.com/jhelsby/OvDSGG/ 上公开获取。