论文

ReQuest:用于长格式视频 QA 的基于重新思考的问题感知帧选择

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

上下文与知识上下文工程

摘要

最近的多模态 大语言模型 (MLLM) 具有相当先进的视频理解能力,但长格式视频 QA 在固定输入 词元预算 下仍然具有挑战性,其中均匀采样对于证据定位来说效率低下。我们提出了 ReQuest,一种不确定性驱动的、问题自适应的关键帧选择管道,通过选择性计算将问题意图与相关视频内容结合起来。 ReQuest 集成了(i)从 MLLM 生成的监督中提取的轻量级问题感知选择器,(ii)重新思考路由,仅当模型使用长度自适应标准不确定时才触发额外的推理,以及(iii)不确定性引导的自适应非极大值抑制,选择时间上不同的帧,同时根据问题难度调整间距。作为一种即插即用的方法,ReQuest 无需修改或 微调 底层 MLLM 即可改进长视频 QA。 Video-MME、MLVU 和 LongVideoBench 上的实验证明了在具有竞争性计算成本的情况下实现了一致的精度增益,尤其是在中长视频状态下的改进尤其显着。