论文
ST-SimDiff:平衡时空相似与差异以实现MLLM高效视频理解
ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs
摘要
多模态大语言模型(MLLM)在处理长视频时面临巨大计算开销,原因在于所需视觉token数量庞大。为提高效率,现有方法主要通过基于重要性或相似性的token剪枝或合并来削减冗余。然而,这些方法在很大程度上忽视了视频内容的一个关键维度,即变化与转折点,且缺乏对时空关系的协同建模。为此,我们提出一个新的视角:相似性用于识别冗余,而差异性用于捕获关键事件。基于此,我们设计了免训练框架ST-SimDiff。我们首先从视觉token构建时空图,以统一建模其复杂关联。随后,我们采用并行双选择策略:1)基于相似性的选择利用社区检测保留代表性token,压缩静态信息;2)基于时间差异的选择精确定位内容变化点,保留那些捕获关键动态转变的token。这使方法能以最少的token同时保留静态与动态内容。大量实验表明,我们的方法在大幅降低计算成本的同时显著优于最先进方法。代码发布于https://github.com/bingjunluo/ST-SimDiff。
