论文
Pocket-STVG:用轻量预训练模块实现视频目标时空定位
Pocket-STVG: lightweight architecture for Spatio-Temporal Video Grounding
摘要
时空视频定位(STVG)旨在定位视频中与自然语言查询相对应的时空管。虽然最近的方法在完全监督、弱监督和零样本设置中实现了强大的性能,但它们通常依赖于计算昂贵的架构、复杂的训练管道或多模态大型语言模型。我们提出了 Pocket-STVG (P-STVG),这是一种轻量级级联架构,通过组合高效的预训练组件而不是大型端到端模型来解决 STVG 问题。 P-STVG 集成了基于 MobileViCLIP 的时间感知视频编码器、源自 MDETR 的空间编码器-解码器以及共享对齐文本编码器。时间定位是通过轻量级 1D U-Net 或简单的阈值策略执行的,使同一框架能够在弱监督和零样本设置中运行。此外,视频表示是独立于查询进行预先计算的,从而产生一个索引友好的管道,用于高效推理和大规模视频收集。尽管需要少于 90M 的参数,P-STVG 的性能与弱监督方法相当,并且以一小部分内存和计算成本改进了早期的零样本方法,为 STVG 建立了有利的性能效率权衡。
