论文

CRAFT:通过视觉语言模型的视频词元的递归自适应融合进行压缩

CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

模型推理推理加速

摘要

在视频理解中,视觉语言模型(VLM)必须摄取大量视觉标记,导致预填充阶段的计算和内存成本急剧上升。这种视觉序列在时空维度上是高度冗余的,但高压缩比往往伴随着关键细节的丢失。现有的词元压缩方法要么采用内容适应性有限的启发式 无需训练 压缩,要么引入需要昂贵的对齐训练的额外模块,从而无法解决效率和适应性之间的权衡。为了缓解这一限制,我们提出了 CRAFT:通过视频词元的递归自适应融合进行压缩。 CRAFT 通过将无参数标记选择与可学习标记融合解耦来递归地合并标记:全局相似性决定要合并哪些标记,而位置感知加权模块和内容自适应通道门则学习如何融合它们。整个压缩管道与查询无关。由于每个保留的标记都是原始标记的线性组合,因此 CRAFT 保留了它们真实的时空坐标,并与预训练语言模型的输入分布保持一致。对多个代表性视频基准的实验表明,CRAFT 始终优于先前最先进的词元压缩方法。在大约 $8\times$ 压缩时,它保留了主干网平均准确度的大约 $97\%$,并显示出显着的效率改进。