论文

FlashGaze:无需训练多尺度补丁修剪以实现高效视频理解

FlashGaze: Training-Free Multi-Scale Patch Pruning For Efficient Video Understanding

模型推理推理加速

摘要

多模态大语言模型 (MLLM) 在视频理解方面表现出了强大的性能,但有效处理长、高分辨率视频仍然具有挑战性。此类视频通常包含大量时空冗余,并且处理冗余视觉token可能会产生可避免的计算开销。许多现有方法在视觉变换器 (ViT) 编码期间或之后修剪视觉token,从而导致大部分编码成本未得到解决。一些方法在编码之前修剪补丁,但依赖学习的辅助网络进行补丁选择,从而产生额外的训练和推理开销。为了解决这些限制,我们提出了 FlashGaze,这是一种无需训练方法,可以在不引入辅助网络的情况下减少 ViT 编码之前的时空冗余。 FlashGaze 使用像素空间差异作为信息丢失的代理,并采用四叉树动态编程来联合优化补丁丢弃、合并和保持在固定预算内。在多个基准测试中对两个MLLM骨干模型进行的实验表明,在很大程度上保持准确性的同时,效率显着提高。在 Qwen3-VL-8B 上,FlashGaze 在 LongVideoBench 上保留了 98% 的全输入基线精度,同时在 ViT 编码和MLLM预填充方面分别实现了高达 5.4 倍和 17 倍的加速,并将峰值 GPU 记忆使用率降低了 1.8 倍。这些效率提升使模型能够在相同的 GPU 硬件上处理更多帧和更高分辨率的视频,从而以以前无法达到的规模解锁视频理解。

FlashGaze:无需训练多尺度补丁修剪以实现高效视频理解的原论文方法或结果图
图 1:我们提出了 FlashGaze,这是一种无需训练方法,使MLLM能够处理 1.5K 帧和 4K 分辨率的视频。现有方法在MLLM之前或内部修剪视觉token,从而在 ViT 中留下大量冗余计算。相比之下,FlashGaze 直接在视频输入阶段修剪补丁,保留 98% 的全输入基线精度,同时将 ViT 和预填充阶段的速度分别提高高达 5.4$\times$ 和 17$\times$。我们还可视化修剪结果,显示 FlashGaze 有选择地保留信息丰富的视觉补丁。