论文

AdaCodec:视频 MLLM 的预测视觉代码

AdaCodec: A Predictive Visual Code for Video MLLMs

上下文与知识上下文工程

摘要

视频在时间上是冗余的:相邻帧通常共享大多数对象、背景和布局。然而,现有的视频多模态 大语言模型(视频 MLLM)通常将每个采样帧编码为独立的 RGB 图像,导致视觉标记重复先前帧中已存在的内容。这建议采用更直接的视频接口:仅当无法从先前的上下文中很好地预测场景时才发送完整的参考帧,否则传输帧间变化的紧凑描述。我们将此接口称为 \emph{预测视觉代码},并将视频 MLLM 实例化为 \textbf{AdaCodec}。仅当条件预测成本较高时,AdaCodec 才会在参考帧上花费完整的视觉标记;否则,它将帧间变化(包括运动和预测残差)编码为紧凑的 P 词元。在所有 11 个基准测试中,AdaCodec 在匹配的视觉 词元预算 上比 Qwen3-VL-8B 每帧 RGB 基线有所改进。即使预算为 1/7$,具有 32k 词元的 AdaCodec 也超过了所有长视频基准的 224k 基线;在五个通用视频基准测试中,它提高了平均分数,同时将首次标记时间从 9.26 秒大幅缩短至 1.62 秒。