论文
OmniVTG:开放世界视频时序定位的大规模数据集与训练方法
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
摘要
视频时间基础(VTG)是从文本查询中本地化视频片段的任务,由于有限的数据集规模和语义多样性,在开放世界环境中陷入困境,导致常见和罕见概念之间的性能差距。为了克服这些限制,我们引入了 OmniVTG,这是一种用于开放世界 VTG 的新型大型数据集,并结合了自校正思想链 (CoT) 训练范例,旨在增强多模态 大语言模型 (MLLM) 的时序定位能力。我们的 OmniVTG 是通过一种新颖的语义覆盖迭代扩展管道构建的,该管道首先识别现有数据集词汇中的差距,并收集极有可能包含这些目标概念的视频。为了获得高质量的注释,我们利用现代 MLLM 比直接基础更擅长密集字幕的洞察力,并设计了一个以字幕为中心的数据引擎来提示 MLLM 生成密集的带时间戳的描述。除了数据集之外,我们观察到简单的监督微调(SFT)是不够的,因为罕见概念和常见概念之间的性能差距仍然存在。我们发现 MLLM 的视频理解能力显着超过了他们的直接时序定位能力。基于此,我们提出了一种自我修正思想链(CoT)训练范式。我们训练 MLLM 首先进行预测,然后利用其理解能力来反思和完善自己的预测。这种能力是通过 SFT、CoT 微调和强化学习的三阶段管道灌输的。大量实验表明,我们的方法不仅在 OmniVTG 数据集的开放世界基础上表现出色,而且还在四个现有 VTG 基准上实现了最先进的零样本性能。代码可在 https://github.com/oceanflowlab/OmniVTG 获取。