论文
FlashGaze:无需训练多尺度补丁修剪以实现高效视频理解
FlashGaze: Training-Free Multi-Scale Patch Pruning For Efficient Video Understanding
摘要
多模态大语言模型 (MLLM) 在视频理解方面表现出了强大的性能,但有效处理长、高分辨率视频仍然具有挑战性。此类视频通常包含大量时空冗余,并且处理冗余视觉token可能会产生可避免的计算开销。许多现有方法在视觉变换器 (ViT) 编码期间或之后修剪视觉token,从而导致大部分编码成本未得到解决。一些方法在编码之前修剪补丁,但依赖学习的辅助网络进行补丁选择,从而产生额外的训练和推理开销。为了解决这些限制,我们提出了 FlashGaze,这是一种无需训练方法,可以在不引入辅助网络的情况下减少 ViT 编码之前的时空冗余。 FlashGaze 使用像素空间差异作为信息丢失的代理,并采用四叉树动态编程来联合优化补丁丢弃、合并和保持在固定预算内。在多个基准测试中对两个MLLM骨干模型进行的实验表明,在很大程度上保持准确性的同时,效率显着提高。在 Qwen3-VL-8B 上,FlashGaze 在 LongVideoBench 上保留了 98% 的全输入基线精度,同时在 ViT 编码和MLLM预填充方面分别实现了高达 5.4 倍和 17 倍的加速,并将峰值 GPU 记忆使用率降低了 1.8 倍。这些效率提升使模型能够在相同的 GPU 硬件上处理更多帧和更高分辨率的视频,从而以以前无法达到的规模解锁视频理解。
