论文

ForestPrune:通过时空森林建模进行视频多模态 大语言模型 的高比率视觉词元压缩

ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling

模型推理推理加速

摘要

由于大大节省了计算和内存开销,词元压缩已成为 MLLM 的研究热点,并在图像语言任务中取得了显着的进展。然而,对于视频,现有方法仍然达不到高比率词元压缩的要求。我们将这一缺点归因于对时间和连续视频内容的建模不足,并提出了一种新颖的视频 MLLM 的 无需训练 词元剪枝方法,称为 ForestPrune,它通过时空森林建模实现有效和高比率的剪枝。在实践中,ForestPrune 基于语义、空间和时间约束跨视频帧构建词元森林,从而对视频进行整体理解。随后,ForestPrune根据树深度和节点角色评估词元树和节点的重要性,从而获得全局最优的剪枝决策。为了验证 ForestPrune,我们将其应用于两个具有代表性的视频 MLLM,即 LLaVA-Video 和 LLaVA-OneVision,并在一系列视频基准上进行了广泛的实验。实验结果不仅显示了视频 MLLM 的巨大有效性,例如,LLaVA-OneVision 保留了 95.8% 的平均准确率,同时减少了 90% 的词元,而且还显示了其比比较的词元压缩方法优越的性能和效率,例如,在 MLVU 上的准确率+10.1%,在 LLaVA-Video 上比 FrameFusion 的修剪时间为 -81.4%。