论文

使用基于注意力的 MLLM 选择器在测试时对长视频进行高效帧选择

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

上下文与知识上下文工程

摘要

使用多模态 大语言模型 (MLLM) 理解长视频需要从数千个候选帧中选择一组紧凑的帧,但识别正确的帧似乎需要首先理解视频。我们通过一个简单的观察来解决这种循环依赖:MLLM 中验证选择的提取层的跨模式关注已经提供了与查询相关的框架证据,而不需要自回归生成。我们利用这个属性来构建 DAFS(基于动态注意力的预算感知帧选择),一个 无需训练 帧选择器。轻量级 MLLM 选择器,即使只有 2B 个参数,也可以通过查询条件聚合将选定层注意力转换为相关性分数来提取帧级证据。这使得跨帧比较无需自回归解码。为了处理选择器自身的上下文约束,我们将候选池大小和每帧 词元预算 的联合分配制定为通过动态规划解决的离散优化问题。在 32 帧预算下,我们的选择器在 Video-MME 上比均匀采样提高了多达 6.4 个点,并且在匹配的帧预算下优于之前基于训练的选择器,同时在选择器和应答器主干以及跨任务之间进行泛化,无需重新训练。