论文

每个高选择性帧一个词元:实现长视频理解的极限压缩

One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding

上下文与知识上下文工程

摘要

由于帧数量众多,长视频理解对于视觉语言模型 (VLM) 来说本质上是一个挑战。由于每个视频帧通常会扩展到数十或数百个标记,大语言模型 (LLM) 的有限上下文长度迫使 VLM 稀疏地感知帧并丢失时间信息。为了解决这个问题,我们在最后的 LLM 层探索了极端的视频词元压缩,每帧一个词元。我们的主要见解是,以前的方法广泛采用的基于启发式的压缩很容易丢失信息,这需要将 LLM 层监督为 词元级 压缩(LP-Comp)的可学习和渐进模块。这种压缩使我们的 VLM 能够消化 2 倍到 4 倍的帧,同时提高性能。为了进一步提高词元效率,我们研究了帧级压缩,它通过 LLM 层的内部注意力分数选择与查询最相关的帧,称为问题条件压缩(QC-Comp)。与之前的研究的显着区别是,我们通过将长视频分割成短片段并采用局部注意力,减轻了 LLM 注意力在长上下文中的位置偏差,即过度集中在序列的开头和结尾。总的来说,我们组合的 词元级 和帧级带来了一种用于长视频理解的极端压缩模型,名为 XComp,实现了显着更大的压缩比并实现了更密集的帧采样。我们的 XComp 在 VideoChat-Flash 的基础上进行了微调,具有数据高效的监督压缩调整阶段,仅需要 2.5% 的监督 微调 数据,却将 LVBench 上的准确性从 42.9% 提高到 46.2%,并增强了多个其他长视频基准测试。