论文

利用合成课程学习组合式视频时空定位

Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum

模型训练合成数据

摘要

尽管最近 MLLM 在视频时空定位(STVG)方面取得了令人印象深刻的进展,但现有的评估和训练数据主要集中在简单的查询上。它们在很大程度上忽略了现实世界场景中普遍存在的组合查询,其中目标必须通过联合推理其属性以及与其他实体的关系来消除歧义。为了弥补这一差距,我们提出了组合时空视频基础(CompSTVG),这项任务需要模型处理复杂的文本查询,其中每个相互交织的属性和关系线索对于消歧至关重要。为了大规模地促进这项任务,我们构建了一个合成数据引擎,利用时空场景图作为难度度量,并将难度控制的查询合成转换为约束编程问题,为评估和训练生成难度分级数据。在此引擎的基础上,我们引入了 STVG-CompBench,这是一个按明确难度级别分层的基准,可共同捕获时间复杂性和空间干扰。在 STVG-CompBench 上评估 11 个代表性 STVG 模型表明,当前模型在组合查询上表现不佳,表现出性能急剧下降,而这种下降通常被整体数据集级别的平均值所掩盖。我们进一步构建合成训练数据并提出 CurrSTVG,这是一种课程强化学习框架,可以提供一致的收益,并且在最具挑战性的组合查询上观察到最大的改进。