论文
时间的形状:VideoLM 中用于时间理解的视频词元对比
The Shape of Time: Video-Token Contrast for Temporal Understanding in VideoLMs
摘要
按顺序查看帧并不意味着代表时间。现代 VideoLM 接收有序视频流,但它们的主要监督作用于生成的文本,而不是事件动态首先出现的视频词元表示。这种不匹配允许模型从对象、场景和语言先验等捷径中学习时间答案,而不需要内部视频表示来捕获事件进展。为了解决这个问题,我们提出了 VT-Contrast,这是 VideoLM 的表示级时间反事实目标。它的设计询问时间监督应该在哪里起作用以及它应该暴露哪些时间差异。 VT-Contrast 监督选定的后期层最后一帧视频标记,其中时间信息预计在语言生成之前集成,并将保序视图与按 Kendall tau 距离分级的相同视频重新排序的反事实进行对比。它不需要架构更改,与各种 VideoLM 训练任务兼容,并提高了跨时间理解基准的整体性能。我们的代码可在 https://github.com/ANDgate99/VT-Contrast 获取。