论文
InfoMerge:用于高效视频的信息感知词元压缩 大语言模型
InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models
摘要
视频大语言模型(Video-LLM)在视频理解方面取得了很强的性能,但其过多的视觉标记带来了大量的计算开销。现有的无需训练压缩方法通过减少视觉标记来提高推理效率,但它们通常依赖于局部相邻帧相似性来进行时间冗余估计或主要根据片段长度来分配词元预算。此类设计对帧级噪声敏感,无法捕获真实视频的不均匀信息分布。为了应对这些挑战,我们提出了 InfoMerge,这是一种 无需训练 视觉词元压缩方法,可通过强大的冗余估计和内容感知预算分配来提高词元利用率。具体来说,我们提出了时间指纹差异:一种分段级二阶时间冗余估计策略,该策略对每个分段内相同空间位置处的标记的时间相似性结构进行建模。我们进一步介绍内容感知预算分配(CABA),它根据片段唯一性和基于谱熵的表征丰富度动态分配片段级 词元预算。通过减少冗余静态区域的重复保存并向信息段分配更多词元,InfoMerge 更好地利用有限的 词元预算,同时保持强大的性能。大量实验表明,InfoMerge 实现了强大的效率——跨多个基准和骨干网的准确性权衡,在积极压缩下具有更明显的优势。在 LLaVA-OneVision-7B 上,InfoMerge 保留了原始平均性能的 98.8%,同时减少了 85% 的视觉标记,并在预填充阶段实现了 4.24 倍的加速。