论文

视频主动感知:使用视觉语言模型进行有效的推理时间长格式视频理解

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

上下文与知识上下文工程

摘要

大型视觉语言模型 (VLM) 具有高级多模态任务,例如视频问答 (QA)。然而,VLM 面临着有效且高效地选择帧的挑战,因为标准均匀采样成本昂贵且性能可能趋于稳定。受主动感知理论的启发,该理论认为模型通过获取与预期不同的数据来获取信息,我们引入了视频主动感知(VAP),这是一种使用 VLM 增强长格式视频 QA 的 无需训练 方法。我们的方法将关键帧选择视为主动感知中的数据采集,并利用轻量级文本条件视频生成模型来表示先验世界知识。根据经验,VAP 在长格式或推理视频 QA 数据集(例如 EgoSchema、NExT-QA、ActivityNet-QA、IntentQA 和 CLEVRER)上实现了最先进的零样本结果,与标准 GPT-4o、Gemini 1.5 Pro 和 LLaVA-OV 相比,每个问题的帧效率提高了 5.6 倍。此外,VAP 表现出比以前的方法更强的推理能力,并有效地选择与问题相关的关键帧。这些发现凸显了利用主动感知来提高长视频 QA 的帧有效性和效率的潜力。