论文
通过自适应准高斯采样实现多模态 大语言模型 的快速有效的长视频理解
Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling
摘要
由于计算量和内存占用过多,长视频理解对于 Multimodal 大语言模型 (MLLM) 来说仍然是一项艰巨的挑战。因此,通常采用关键帧选择来缓解这一缺点,但由于其硬采样原理,仍然存在灵活性低和噪声高的问题。在本文中,我们将视频帧选择定义为准高斯采样问题,并提出了一种称为 AdaQ 的自适应 无需训练 方法。受高斯分布的 3-$σ$ 规则的启发,AdaQ 的目标是针对不同的示例实现最佳的 3-$σ$ 区间,即局部查询的 3-$σ$ 区间较小,全局查询的 3-$σ$ 区间较大,从而促进稳健和自适应的帧采样。为了验证 AdaQ,我们将其应用于具有三个嵌入模型的四个 MLLM。大量的实验结果不仅显示了其相对于默认 MLLM 和 SOTA 关键帧选择方法的明显性能提升,例如仅使用 64 帧帮助 Qwen3-VL-8B 平均优于 GPT4o 15.8%,而且还证实了其卓越的鲁棒性和长视频理解的高效率,例如只需设置 1 个超参数。