论文

ST-SimDiff:平衡时空相似与差异以实现MLLM高效视频理解

ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs

上下文与知识上下文工程

摘要

多模态大语言模型(MLLM)在处理长视频时面临巨大计算开销,原因在于所需视觉token数量庞大。为提高效率,现有方法主要通过基于重要性或相似性的token剪枝或合并来削减冗余。然而,这些方法在很大程度上忽视了视频内容的一个关键维度,即变化与转折点,且缺乏对时空关系的协同建模。为此,我们提出一个新的视角:相似性用于识别冗余,而差异性用于捕获关键事件。基于此,我们设计了免训练框架ST-SimDiff。我们首先从视觉token构建时空图,以统一建模其复杂关联。随后,我们采用并行双选择策略:1)基于相似性的选择利用社区检测保留代表性token,压缩静态信息;2)基于时间差异的选择精确定位内容变化点,保留那些捕获关键动态转变的token。这使方法能以最少的token同时保留静态与动态内容。大量实验表明,我们的方法在大幅降低计算成本的同时显著优于最先进方法。代码发布于https://github.com/bingjunluo/ST-SimDiff。

ST-SimDiff:平衡时空相似与差异以实现MLLM高效视频理解:论文配图
图 1:ST-SimDiff 的核心动机。我们假设有效的视频理解需要同时处理两个场景:时空相似性(左)可用于压缩帧内空间上和相邻帧之间时间上的冗余信息。应检测时间差异(右)以捕获定义情节的关键动作或事件。