论文

用于长视频理解的与 MLLM 无关的即插即用关键帧选择方法的评估

Evaluation of MLLM-Agnostic Plug-and-Play Keyframe Selection Methods for Long Video Understanding

模型评测模型能力评测

摘要

由于视觉标记和计算预算的限制,多模态大语言模型(MLLM)无法处理长视频的每一帧。人们提出了三种主要方法来增强其长视频理解能力:(i)在大型视频语料库上重新训练 MLLM 和/或扩展其输入长度; (ii) 为特定 MLLM 训练适配器,该适配器将整个视频和查询作为输入并选择最相关的视频帧; (iii) 开发与 MLLM 无关的免训练、即插即用 (PaP) 适配器。我们将第三种方法称为 PaP 关键帧选择。 PaP方法可以仅使用候选视频帧而不考虑查询,或者它可以使用候选视频帧和查询两者。第一种方法成本高昂。第二种方法需要大量的训练时间和计算资源,但许多人都可以使用它,因为适配器包含的可训练参数比整个 MLLM 少得多。第三种方法的计算成本最低,因此可以广泛使用。据我们所知,去年仅报道了五种 PaP 方法。所有这些方法都已在一个或多个视频问答基准上进行了评估,并证明了对长视频理解的改进。然而,这些方法是使用不同的 MLLM 在不同的基准上进行评估的。我们使用三个 MLLM 在三个长视频理解基准上对这五种方法进行了综合评估。我们的结果表明,QAaF 在 15 项综合评估设置中的 13 项中取得了最佳表现,而 FOCUS 总体排名第二。这些结果为比较 MLLM 的免训练关键帧选择方法提供了通用的实验参考。