论文
Tango:驯服视觉信号以实现高效视频 大语言模型
Tango: Taming Visual Signals for Efficient Video Large Language Models
摘要
词元修剪已成为开发高效视频 大语言模型(视频 LLM)的主流方法。这项工作重新审视并推进了两种主要的标记修剪范例:基于注意力的选择和基于相似性的聚类。我们的研究揭示了现有方法的两个关键局限性:(1)传统的 top-k 选择策略无法充分考虑注意力分布,这种分布通常是空间多模态且大小长尾的; (2)直接基于相似性的聚类经常生成碎片簇,导致池化后的表示失真。为了解决这些瓶颈,我们提出了 Tango,这是一种旨在优化视觉信号利用的新颖框架。 Tango 集成了多样性驱动策略来增强基于注意力的标记选择,并引入时空旋转位置嵌入(ST-RoPE)以通过局部先验保留几何结构。各种视频 LLM 和视频理解基准的综合实验证明了我们方法的有效性和通用性。值得注意的是,当仅保留 10% 的视频词元时,Tango 保留了 LLaVA-OV 上 98.9% 的原始性能,同时提供 1.88$\times$ 的推理加速。