论文

用于长视频理解的线性缩放视频 VLM

Linear Scaling Video VLMs for Long Video Understanding

模型推理KV Cache

摘要

视频视觉语言模型 (VLM) 越来越多地用于长视界和流媒体设置,但大多数视频编码器仍然依赖于时空自注意力,导致计算和延迟随着帧数呈二次方增长。现有的效率方法提高了可扩展性,但相对于完全自注意力,通常会损失准确性,例如通过积极的帧/词元​​丢弃或粗略的注意力近似。我们引入了 StateKV,这是一种推理时间方法,通过在固定容量、基于重要性的循环状态中携带跨帧上下文,并与用于解码的第二个完整每帧缓存配对,使预训练的长视频 VLM 适应线性时间视频预填充。在三个长视频基准测试和跨越三个系列和多个尺度的七个模型中,StateKV 仍然接近完全自注意力,并且始终优于占主导地位的滑动窗口/基于新近度的流近似,无需 微调 或架构更改。 StateKV 还降低了视频预填充成本测量的 FLOP,通过运行更大的模型,在固定计算预算下实现更高的准确性。这些结果表明朝着可扩展的长视频理解迈出了实际的一步。