论文
HieraVid:快速视频的分层词元修剪 大语言模型
HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models
摘要
Video 大语言模型 (VideoLLM) 在视频理解方面表现出了令人印象深刻的能力,但大量的输入视频词元给部署带来了巨大的计算负担。现有方法主要在输入级别修剪视频标记,而忽略了视频和大语言模型(LLM)中嵌入的固有信息结构。为了解决这个问题,我们提出了 HieraVid,一种分层修剪框架,可以逐步动态地减少视觉冗余。基于视频具有分段帧结构和 LLM 内部单向传播多模态信息的两个观察,我们将剪枝分解为三个级别:1)分段级,其中视频标记首先在时间上分段并在空间上合并; 2)帧级,同一段内的相似帧被联合修剪以保持多样性; 3)层级,随着 LLM 层的增加,冗余逐渐缩小,而不会影响性能。我们对四个广泛使用的视频理解基准进行了广泛的实验,以综合评估 HieraVid 的有效性。值得注意的是,仅保留 30% 的词元,HieraVid 就实现了新的最先进性能,同时分别保持了 LLaVA-Video-7B 和 LLaVA-OneVision-7B 98% 和 99% 以上的性能。