论文

GIFT:全局不可替代性帧定位以实现高效视频理解

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

上下文与知识上下文工程

摘要

视频 大语言模型 (VLM) 在视频理解方面取得了显着的成功,但处理密集帧的巨大计算成本严重限制了它们的实际应用。现有方法通过选择关键帧来缓解这一问题,但它们的贪婪决策,加上对相关性和多样性的解耦评估,常常陷入局部最优,并导致错误地选择不相关的噪声帧。为了应对这些挑战,我们提出了 GIFT:全局不可替代性框架目标,这是一种新颖的 无需训练 框架,通过评估其内在的不可替代性来选择框架。具体来说,我们首先引入定向多样性来量化以相关性为条件的框架的独特性,这使我们能够制定统一的不可替代性得分。随后,我们的预算感知细化策略采用自适应迭代过程,首先确保具有最高不可替代性的核心框架集,然后随着预算的扩大,将其优先级转移到围绕这些选择构建关键的时间背景。大量实验表明,与均匀采样相比,GIFT 在 LLaVA-Video-7B 上的长格式视频基准测试中实现了 12.5% 的最大平均改进。