论文
连接时间和空间:视频时空定位的解耦时空对齐
Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding
摘要
视频时空定位需要基于自然语言查询在时间和空间维度上联合定位目标对象,这对现有的多模态 大语言模型 (MLLM) 提出了根本挑战。我们确定了两个核心挑战:\textit{纠缠的时空对齐},是由于在同一自回归输出空间内耦合两个异构子任务而产生的;\textit{双域视觉标记冗余},其中目标对象表现出同时的时间和空间稀疏性,使得绝大多数视觉标记与定位查询无关。为了解决这些问题,我们提出了 \textbf{Bridge-STG},这是一种端到端框架,可以在保持语义一致性的同时解耦时间和空间定位。虽然解耦是解决这种纠缠问题的自然解决方案,但它有可能在时间 MLLM 和空间解码器之间产生语义差距。 Bridge-STG 通过两个关键设计解决了这个问题:具有显式时间对齐 (ETA) 的 \textbf{时空语义桥接 (STSB)} 机制将 MLLM 的时间推理上下文提炼为丰富的桥接查询,作为强大的语义接口; \textbf{查询引导空间定位(QGSL)}模块利用这些查询来驱动具有多层交互式查询和正/负帧采样的专用空间解码器,共同消除双域视觉词元冗余。跨多个基准的大量实验表明,Bridge-STG 在基于 MLLM 的方法中实现了最先进的性能。 Bridge-STG 将 VidSTG 上的平均 m\_vIoU 从 26.4提高到 34.3,并在统一的多任务训练机制下展示了跨各种细粒度视频理解任务的强大跨任务传输。