论文
无需训练 用于一般视频理解的时间抽象
Training-Free Temporal Abstraction for General Video Understanding
摘要
逐帧分析视频的成本很高,但许多视频理解任务依赖于了解相关时刻发生的位置。系统可能需要发现动作何时发生变化,定位句子描述的片段,或者为视觉语言模型选择几个帧。现有的方法通常使用特定于任务的训练数据或专门的架构来单独解决这些问题。我们研究预训练的视频文本模型是否可以提供足够的时间结构来同时支持其中多个任务。我们提出了 STITCH,一种 无需训练 方法,它将视频划分为语义上有意义的时间块。 STITCH 将短视频窗口嵌入到冻结的视频文本主干中,并检测生成的嵌入序列中的变化。这些块每个视频计算一次并在任务之间重复使用。我们在通用事件边界检测、基于语言的时刻检索和长视频 VLM 推理的帧选择方面评估了 STITCH。在所有三种设置中,STITCH 与更专业的方法相比仍然具有竞争力,同时不需要特定于任务的训练,当仅可以处理少量帧或词元时,效果尤其明显。这些结果表明,可重用的时间抽象是一般视频理解的一个有前途的方向,允许密集的视频流一次转换为可以由下游系统本地化、检索、采样或推理的语义单元。