论文

通过最佳传输聚合视觉信息以进行 VideoLM 词元压缩

Aggregating Visual Information with Optimal Transport for VideoLM Token Compression

上下文与知识上下文工程

摘要

视频语言模型将视频处理为具有大量表征冗余的密集视觉标记序列。因此,压缩这些序列对于减少语言模型解码的视觉标记负担至关重要。核心挑战是在这种压缩下保留分散在帧中的视觉信息。为此,我们引入了通过最佳传输聚合视觉信息(AVIOT),它将视频词元压缩视为将帧观察的密集经验测量传输到紧凑的目标测量上。由此产生的源到目标耦合会导致每个目标支持的源观察分布,直接指定如何构建压缩视频表示。我们沿着任务和空间轴进一步调整这种结构。问题调节调节源帧和目标支持之间的传输成本,同时影响分配给每个时间段的支持数量,从而将表示能力引导到与问题相关的内容。在多个空间粒度上,AVIOT 计算特定于区域的时间传输计划并自适应地融合它们产生的表示,从而允许同一紧凑表示中的不同区域从不同时刻进行绘制。对不同压缩比的评估表明,AVIOT 在多个视频理解基准上匹配或优于未压缩基准,同时在较高压缩比下保持强大的性能。