论文
关注点:用于长视频理解的查询调制多模式关键帧选择
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
摘要
由于处理密集帧序列的成本过高,长视频理解对于多模态 大语言模型 (MLLM) 来说仍然是一个巨大的挑战。流行的关键帧选择方法依赖于单个以视觉为中心的度量(例如 CLIP 相似性)或启发式分数的静态融合。这种“一刀切”的范式经常失败:仅视觉指标对于情节驱动的叙事查询无效,而不加区别地添加文本分数会给纯粹的视觉任务带来严重的“模态噪音”。为了打破这个瓶颈,我们提出了 Q-Gate,一个即插即用的 无需训练 框架,它将关键帧选择视为动态模态路由问题。我们将检索解耦为三个轻量级专家流:局部细节的视觉基础、场景语义的全局匹配以及字幕驱动叙述的上下文对齐。至关重要的是,Q-Gate 引入了一种查询调制门控机制,该机制使用 LLM 的上下文推理来评估查询意图并在专家之间动态分配权重,激活必要的模式,同时“静音”不相关的模式以最大化信噪比。在跨多个 MLLM 主干的 LongVideoBench 和 Video-MME 上进行的广泛实验表明,Q-Gate 在大多数设置中都优于代表性的关键帧选择基线,尤其是在长视频和中视频上有显着的提升,为可扩展视频推理提供了强大且可解释的解决方案。