论文

UniversalVTG:视频时序定位的通用轻量级基础模型

UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding

模型训练预训练

摘要

视频时序定位(VTG)通常使用特定于数据集的模型来解决,这些模型在跨领域和查询样式之间的传输效果很差。最近克服这一限制的努力已将大型多模态语言模型 (MLLM) 应用于 VTG,但其高计算成本和有限的视频上下文仍然阻碍长视频定位。相反,我们在保持模型轻量级的同时扩展了统一监督。我们提出了 UniversalVTG,这是一个经过大规模跨数据集预训练训练的单一 VTG 模型。离线查询统一器将异构查询格式标准化为共享声明空间,减少语言不匹配并防止在朴素联合训练下观察到的负迁移。与高效的时序定位头相结合,UniversalVTG 可缩放至未经修剪的长视频。在不同的基准测试(GoalStep-StepGrounding、Ego4D-NLQ、TACoS、Charades-STA 和 ActivityNet-Captions)中,与专用 VTG 模型相比,一个 UniversalVTG 检查点实现了最先进的性能。此外,尽管与最近基于 MLLM 的方法相比,UniversalVTG 的模型规模缩小了100倍以上,但它在多个基准测试中的准确性达到或超过了它们,为参数较多的 MLLM 提供了实用的替代方案。