论文

GleanVID:高效视频大语言模型的补充词元选择

GleanVID: Complementary Token Selection for Efficient Video Large Language Models

摘要

视频大语言模型(VideoLLM)已经实现了强大的视频理解能力,但由于大量的视觉标记而产生大量的推理开销。现有的 VideoLLM 词元压缩方法很大程度上依赖于与选择无关的评分,忽略了跨帧互补性,从而保留了跨帧的冗余证据。相反,我们将视频词元选择视为一个渐进的证据积累过程。它的目的是在有限的词元预算下保留单独提供信息且集体互补的视觉证据。基于这一见解,我们推出了 GleanVID,这是一种适用于 VideoLLM 的免训练推理加速框架。具体来说,GleanVID首先根据时间新颖性跨帧分配全局词元预算,然后通过共同考虑局部代表性和子空间互补性来选择词元,从而保留更丰富且更少冗余的视觉证据。跨不同 VideoLLM 和基准的大量实验表明,GleanVID 始终能够实现最先进的性能。值得注意的是,GleanVID 仅使用 25% 的视觉标记,保留了 Qwen3-VL 98.6% 的原始性能,同时将其预填充延迟降低了 44.7%。在 LLaVA-OV-7B 上,GleanVID 的保留率为 25%,甚至略微超过了原始模型。