论文
EchoPrune:将冗余解释为高效视频大语言模型的时间回声
EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs
摘要
对于视频 大语言模型 (VideoLLM) 来说,长格式视频理解仍然具有挑战性,因为密集帧采样引入了大量视觉标记,而稀疏采样则存在丢失关键时间证据并导致 LLM 幻觉的风险。现有的 无需训练 词元缩减方法要么将视频视为静态图像,要么依赖分段级合并启发式方法,这会削弱细粒度时空建模并引入额外的开销。在本文中,我们提出了 EchoPrune,一种轻量级的 无需训练 词元修剪方法,可在固定的 LLM 侧视觉 词元预算 下提高时间分辨率。我们的核心思想是将冗余视频标记解释为时间回声:如果一个标记可以从前一帧很好地重建,那么它只是一个时间冗余回声;否则,它可能会捕获新的事件、动作或与查询相关的视觉证据。基于这一见解,EchoPrune 通过 (i) 查询引导的跨模态相关性和 (ii) 时间重建误差对视觉标记进行评分,通过连续帧之间的对应匹配和回声匹配来测量。选定的标记保留了任务相关的线索和时间新颖性,同时抑制了可预测的冗余,从而允许 VideoLLM 观察更多帧而不增加解码预算。在 LLaVA-OV、Qwen2.5VL 和 Qwen3VL 上跨六个视频理解基准进行的广泛实验表明,EchoPrune 使 VideoLLM 在相同的 词元预算 下能够处理多达 20 倍的帧,从而在 Qwen2.5VL-7B 上提高性能 (+8.6%) 和推理加速(预填充为 5.6 倍)。