论文

定位视频中的任意目标:高效生成式视频时空定位

Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding

模型推理批处理与并行

摘要

视频时空定位(STVG)需要识别所指事件发生的时间,并在整个区间内定位目标。现有多模态大模型通常自回归输出密集定位轨迹,解码延迟随轨迹长度增加,定位错误也会跨时间传播。我们提出并行目标轨迹解码(PTD),先生成时间块,再同时解码以时间为条件的空间块,消除词元级和轨迹级依赖,将顺序解码固定为1+1轮,与目标轨迹长度无关。解耦块注意力保留共享视频及查询上下文,同时消除跨定位框依赖;定位感知策略优化用于时间边界与空间几何。在VidSTG上,相比标准自回归解码,PTD使目标轨迹完成延迟降至约1/79,空间解码吞吐量提高92倍,并改善定位准确率。采用4B基础模型,在VidSTG和HC-STVG上表现良好,也能零样本泛化到时间定位、带视觉证据的视频问答及指代视频目标跟踪。结果说明并行轨迹生成可作为视频自回归定位的高效替代。