论文
追踪时间之箭:诊断视频中的时间信息流-LLM
Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs
摘要
时间之箭 (AoT) 任务通过识别时间不可逆性来确定视频是向前还是向后播放,是人类以近乎完美的精度解决的一项任务,但前沿视频 大语言模型 (Video-LLM) 的表现仅略高于偶然性。这一差距提出了一个关键问题:视觉主干是否无法编码时间信息,或者信息瓶颈是否位于 Video-LLM 架构的其他地方?我们通过将视觉编码器与 Video-LLM 隔离并跟踪编码器、投影仪和 LLM 之间的时间信息来解决这个问题。我们发现具有显式时间建模的以视频为中心的编码器可以编码强时间信号,而以帧为中心的编码器则不能。然而,当以视频为中心的表示通过标准 Video-LLM 架构时,性能通常会崩溃,从而暴露出时间信息流的瓶颈。我们将投影仪设计视为一个关键因素:Q-Former 会扰乱时间信息,而保存时间的 MLP 投影则大大改善了 LLM 对此类信息的访问。我们的逐层分析进一步显示了编码器层之间的时间表示动态。在这些发现的指导下,我们构建了一个 Video-LLM,它具有以时间感知的视频为中心的编码器、保留时间的投影仪和 AoT 监督,以 98.1% 的准确度超越了 AoT$_{PPB}$ 上的人类表现,并将更广泛的时间推理任务在 VITATECS-Direction 上提高了 6.0 分,在 TVBench 上提高了 1.3 分。我们的结果表明,Video-LLM 中的时间推理需要有效的时间编码以及将此信息可靠地传输到 LLM。