论文

使用全局密码本重新思考视频词元压缩:学习一次,到处压缩

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

模型推理推理加速

摘要

视频 大语言模型 (Video-LLM) 将视频表示为密集的视觉标记序列,其长度随着输入的时间和空间范围而增长。这些标记通常包含由于重复的视觉模式而产生的大量冗余,导致后续语言模型处理中不必要的计算。现有的词元压缩方法(包括修剪和合并)在推理过程中在线执行压缩,对每个输入视频反复进行额外的计算,并且通常依赖于限制其通用性的特定于模型的设计,我们通过将昂贵的压缩过程转移到离线状态来重新思考这种范例。我们提出了 \textbf{ONCE},一个插件视频词元压缩框架,它引入了离线到在线范例:在视觉特征空间中学习一次频率感知的全局码本,并通过码本查找和聚合重用于轻量级在线压缩,减少每个视频的重复计算和特定于模型的压缩设计的需要。跨多个视频理解基准和针对不同压缩基准的广泛实验表明,我们的方法实现了强大的准确性与效率权衡,在保持竞争性能的同时实现了比较方法中最低的推理延迟。