论文
RESUME:来自运动和残留信号的循环状态更新,用于高效的视频语言建模
RESUME: Recurrent State Updates from Motion and Residual Signals for Efficient Video Language Modeling
摘要
现有的视频语言模型独立地对采样的 RGB 帧进行编码,因此长视频必须要么耗尽词元预算,要么放弃采样帧之间的变化。编解码器感知前端读取编码产生的运动向量和残差,但在其部署形式中,每个预测帧仍然自行标记化:标记是当前基元的函数,而不是携带的引用的函数。我们认为更自然的函数是当前原语和携带的引用两者兼而有之。剪辑及其时间反转共享相同的帧,仅在变化的顺序上有所不同(对称池通过构造丢弃的轴,并且在 VideoLM 使用的冻结视觉特征中非空),并且编解码器循环已经按照参考状态的顺序组合了这些变化。我们引入了 RESUME,一种有状态的编解码器表示:锚点 I 帧初始化紧凑的潜状态,每个后续预测帧都被用作该状态的更新,并且共享读出从累积状态中公开 VideoLM 兼容的词元。因此,编解码器预测保持在表示级别,并作为轨迹而不是作为一组独立的标记组交给语言模型。在与先前的编解码器感知方法相同的每个预测帧词元预算下,预测帧作为前端已知内容的读出进入语言模型,而不是单独作为当前原语的编码。在十个基准测试中,收益集中在时间推理上:在所有三个时间基准测试中,RESUME 都比 RGB 帧基线 LLaVA-Video-7B(在 TempCompass、TOMATO 和 MVBench 上提高了 2.8、5.1 和 3.9 点)和基于编解码器的基线 CoPE-7B 都有改进,同时在一般和长格式 QA 上保持竞争力。冻结转换测试进一步显示了锚点依赖性、顺序敏感性以及超出训练范围的有用的rollout行为。