论文
小视觉语言模型是用于长视频理解的智能压缩器
Small Vision-Language Models are Smart Compressors for Long Video Understanding
摘要
针对长达一小时的视频采用多模态 大语言模型 (MLLM) 会受到上下文限制的瓶颈。密集的视觉流使 词元预算 饱和并加剧了迷失在中间的现象。现有的启发式方法,例如稀疏采样或均匀池化,通过丢弃决定性时刻并在不相关的背景上浪费带宽来盲目地牺牲保真度。我们提出了 Tempo,一种高效的查询感知框架,可压缩长视频以供下游理解。 Tempo 利用小视觉语言模型 (SVLM) 作为本地时间压缩器,将标记缩减作为早期跨模态 蒸馏 过程,以在单个前向传递中生成紧凑的、意图一致的表示。为了在不破坏因果关系的情况下执行严格的预算,我们引入了自适应词元分配(ATA)。利用 SVLM 的零样本相关先验和语义前端加载,ATA 充当 无需训练 $O(1)$ 动态路由器。它为查询关键段分配密集的带宽,同时将冗余压缩到最小的时间锚点以维持全局故事情节。大量实验表明,我们的 6B 架构通过积极的动态压缩(0.5-16 个词元/帧)实现了最先进的性能。在超长的 LVBench(4101s)上,Tempo 在严格的 8K 视觉预算下得分为 52.3,表现优于 GPT-4o 和 Gemini 1.5 Pro。缩放到2048帧达到53.7。至关重要的是,Tempo 将长达一小时的视频压缩得大大低于理论限制,证明真正的长视频理解依赖于意图驱动的效率,而不是贪婪地填充上下文窗口。