论文
OTT-Vid:视频的最佳传输时间词元压缩 大语言模型
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
摘要
随着视频 大语言模型 (Video-LLM) 扩展到更长、更复杂的视频,由于跨帧积累的大量视觉标记,其推理成本迅速增长。 无需训练 词元压缩已成为解决此瓶颈的实用解决方案。然而,现有的时间压缩方法主要依赖于跨帧标记相似性或分段启发式,忽略了每个标记在其帧内的语义角色,并且未能使压缩强度适应每个帧对的可压缩性。在这项工作中,我们提出了 OTT-Vid,一种用于时间词元压缩的传输派生分配框架。我们的方法由两个阶段组成:空间修剪识别每个帧内的代表性内容,然后解决相邻帧之间的最佳传输(OT)以估计时间压缩性。我们用非均匀的词元质量来制定这个 OT,它可以保护语义上重要的词元免受激进的压缩,以及捕获特征和空间差异的局部感知成本。由此产生的传输计划共同平衡了词元重要性和匹配成本,而其总成本定义了每个帧对的传输难度,我们用它来动态分配压缩预算。对涵盖视频问答和时间基础的六个基准进行的实验表明,OTT-Vid 保留了 95.8% 的 VQA 和 73.9% 的 VTG 性能,同时仅保留 10% 的词元,始终优于现有最先进的 无需训练 压缩方法。