论文
ViKey:通过视觉提示增强视频的时间理解
ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting
摘要
Video 大语言模型 (VideoLLM) 的最新进展在不同的多模式视频任务中实现了强大的性能。为了降低处理密集视频帧的高计算成本,帧选择等面向效率的方法已被广泛采用。虽然这些方法可以有效地减少冗余,但通常会导致需要时间推理的任务的性能显着下降。与人类可以从稀疏的视觉线索推断事件进展不同,VideoLLM 在省略中间帧时经常会误解时间关系。为了解决这个限制,我们探索视觉提示(VP)作为一种轻量级但有效的方法来增强 VideoLLM 中的时间理解。我们的分析表明,简单地用明确的序数信息注释每个帧有助于模型感知时间连续性。这种视觉提示还支持帧级参考并减轻稀疏采样序列中的位置模糊性。基于这些见解,我们引入了 ViKey,这是一个 无需训练 框架,它将 VP 与轻量级关键字框架映射 (KFM) 模块相结合。 KFM 利用帧索引作为类似字典的键,将文本提示链接到最相关的帧,从而在推理过程中提供明确的时间锚点。尽管很简单,但我们的方法极大地改进了时间推理,并且在某些数据集上,用少至 20% 的帧保留了密集帧基线性能。