论文

基于图像表示的视频编码器

Video Encoders Built on Image Representations

摘要

视频编码器的设计决定了帧何时开始交互以及语言模型仍然可以访问哪些特定于帧的视觉证据。本机视频路径在视觉编码期间耦合相邻帧,而图像路径保留独立计算的帧表示,但在转发所有图像token时会产生更大的视觉token成本。我们提出一个基本问题:紧凑型视频编码器是否可以构建在图像表示上。为了回答这个问题,我们将三个经常耦合的操作分开:每帧表示、跨帧token分配和时间交互。冻结图像编码器首先产生特定于帧的候选者。然后,问题感知选择器使用相关性、多样性和跨帧对应来跨帧分配固定的token预算,之后轻量级学习精炼器读取相邻帧上下文并仅将剩余更新写入保留的锚点。这保留了源位置并将视觉输出保持在固定预算。在 13 个基准测试和三种视觉语言骨干模型中,生成的路径与全图像聚合性能相匹配,同时仅使用其视觉token的约 28%-35%。具体来说,在 Qwen3-VL-8B 上,它在 1,535 个视觉token上实现了 62.75 的 13 个基准宏观平均值,而在 4,424 token处的完整图像路径为 62.58,在 2,212 token处的原生 Conv3D 为 59.49。在 Qwen3-VL-32B 上,它的 13 个基准测试宏平均值为 66.28,而 Image 为 66.09,同时提供 2.16 倍的端到端加速。这些结果表明,紧凑视频编码不需要早期时间混合:可以首先保留特定于帧的证据,联合分配,并在选择后进行时间上下文化。

基于图像表示的视频编码器的原论文方法或结果图
图 1:图像优先视频编码。 (a) 独立编码保留特定于帧的候选;协调选择分配token预算;可选的细化添加了时间上下文,无需额外的输出token。 (b–c) 结果比较完整的路径。