论文

基于 MLLM 的长格式视频理解的查询条件证据关键帧采样

Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding

上下文与知识上下文工程

摘要

多模态 大语言模型 (MLLM) 在视频问答方面表现出了强大的性能,但它们在长格式视频中的应用受到有限的上下文长度和计算成本的限制,因此关键帧采样至关重要。现有的方法通常依赖于语义相关性或强化学习,它们要么无法捕获证据线索,要么遭受低效的组合优化。在这项工作中,我们提出了一种基于信息瓶颈理论的证据驱动的关键帧采样框架。我们将关键帧选择制定为最大化所选帧和查询之间的条件互信息,提供反映每个帧对回答问题的贡献的原则性目标。为了使这个目标易于处理,我们利用其结构来导出分解的优化,将子集选择减少到独立的帧级评分。我们进一步引入了一个以查询为条件的证据评分网络,该网络经过对比目标的训练,可以有效地估计证据的重要性。长格式视频理解基准的实验表明,我们的方法在严格的 词元预算 下始终优于先前的采样策略,同时显着提高了训练效率。