论文
用于高效视频中细粒度视频理解的接收器词元感知剪枝 LLM
Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs
摘要
由于向 LLM 提供大量视觉标记,视频 大语言模型(视频 LLM)会产生较高的推理延迟。为了解决这个问题,无需训练 视觉词元剪枝作为一种降低计算成本的解决方案应运而生;然而,现有方法主要在多项选择题回答(MCQA)基准上进行验证,其中粗粒度线索通常就足够了。在这项工作中,我们揭示了这些方法在需要精确视觉基础的细粒度理解任务(例如幻觉评估)上遭受了急剧的性能崩溃。为了探索这一差距,我们进行了系统分析,并确定了接收器标记(语义上无信息但引起过度关注的标记)作为细粒度视频理解的关键障碍。当这些接收器词元在修剪后幸存下来时,它们会扭曲模型的视觉证据并阻碍细粒度的理解。受这些见解的启发,我们提出了 Sink-Token-aware Pruning (SToP),这是一种简单而有效的即插即用方法,它引入了 Sink 分数来量化每个词元充当 Sink 的趋势,并将该分数应用于现有的空间和时间剪枝方法以抑制它们,从而增强视频理解。为了验证 SToP 的有效性,我们将其应用于最先进的修剪方法(VisionZip、FastVid 和 Holitom),并在涵盖幻觉、开放式生成、组合推理和 MCQA 等不同基准上对其进行评估。我们的结果表明,即使修剪了高达 90% 的视觉标记,STOP 也能显着提高性能。