论文

VETO:视觉语言模型的视频高效词元优化

VETO: Video Efficient Token Optimization for Vision Language Models

上下文与知识上下文工程

摘要

使用视觉语言模型 (VLM) 处理长视频受到视觉词元的二次成本的瓶颈,使得长视频推理成本过高。虽然单轴压缩方法缓解了这一问题,但它们却达到了硬效率底线,因为它们独立地处理空间和时间冗余。我们提出了 VETO(视觉语言模型的视频高效词元优化),这是一个训练可选插件,通过双轴压缩消除了这一瓶颈:(i) 帧内压缩器,通过最优传输启发匹配合并每个帧内语义相似的词元,以及 (ii) 帧间压缩器,识别和合并时间冗余帧。关键的设计见解是分层排序:通过首先压缩空间维度,VETO 大大降低了后续全局时间匹配的成本,绕过了单轴方法的效率墙,其优势随着现代完全融合的注意力基础设施而增长。根据经验,VETO 的推理速度最高提高45%(例如,在 LLaVA-OneVision-7B 上),同时保持或提高了准确性。在极端词元匮乏(10% 预算)下,VETO 的表现优于 VFlowOpt (54.9%)、VisionZip (52.6%) 和 FastV (47.9%),准确率为 55.7%。我们证明了 LLaVA-OneVision、InternVL-2.5 和 LongVA 的普遍适用性,在所有情况下都保持或提高了零样本精度。