论文
GSTEP:全局时空密度驱动的视觉词元修剪,实现高效视频 大语言模型
GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models
摘要
视频 大语言模型 (VideoLLM) 实现了强大的视频理解性能,但由于长视频中存在大量冗余时空视觉标记,其推理仍然昂贵。现有的词元剪枝方法通过减少冗余词元来减轻这种成本,但大多数方法都依赖于片段级本地剪枝,其中视频被划分为独立的片段,并且在每个片段内独立选择词元。此类设计可能无法充分保留简短但语义密集的片段,并丢弃局部看起来不显着但从全局角度来看仍然至关重要的标记。为了解决这个问题,我们提出了 GSTEP(全局时空密度修剪),这是一种即插即用的修剪框架,将视频建模为连续的时空信息流。 GSTEP通过将从平滑中心帧级变化信号获得的连续时间密度与帧内空间密度相结合来构造词元级时空密度,然后通过联合平衡信息密度和覆盖范围来执行全局词元采样。对多个 VideoLLM 和公共基准的大量实验表明,GSTEP 始终如一地实现了强大的准确性与效率权衡,并且在模型架构和评估设置之间具有良好的泛化性。在 LLaVA-OneVision-7B 上,GSTEP 修剪了 75% 的视觉标记,在基准测试中保留了高达 100.2% 的原始平均性能,并实现了 1.17 的端到端加速。