论文
在它消失之前:在 VideoLLM 中强化推理时间的时间表示
Before It Fades: Reinforcing Temporal Representations at Inference Time in VideoLLMs
摘要
视频大语言模型 (VideoLLM) 按顺序接收帧并解释视觉内容如何沿时间轴演变,但时间推理仍然是跨架构的持续弱点。反转视频的帧顺序(一种应反转时间答案的转换)通常会使最终预测保持不变。我们通过定义时间散度向量 $τ_l$(由反转时间顺序引起的分层表示差异)来调查这种失败的根源。跨层跟踪其幅度揭示了一致的时间发散轮廓,其中发散在中间层达到峰值并逐渐减小到输出。我们确认该峰值特定于时间推理并且对于预测在功能上至关重要,从而确定 VideoLLM 在中间层获取时间信息但无法将其保留到输出。这种渐进式衰落激发了我们的方法“时间激活注入”(TAI),该方法在每个输入的轮廓峰值处提取 $τ_l$,并在测量到的衰减后将其重新注入到后续层中。 TAI 不需要训练,并且在三个 VideoLLM 和四个基准上持续改进时间推理,对非时间任务的影响可以忽略不计。代码可在 https://github.com/Youngwoo-git/Before-It-Fades. 获取