论文

使用 MLLM 代理进行渐进式视频压缩以实现长格式视频理解

Progressive Video Condensation with MLLM Agent for Long-form Video Understanding

上下文与知识上下文工程

摘要

理解长视频需要在计算预算紧张的情况下从长序列中提取与查询相关的信息。现有的先文本后 LLM 管道会失去细粒度的视觉线索,而基于视频的多模态 大语言模型 (MLLM) 可以保留视觉细节,但帧消耗太大且计算成本高昂。在这项工作中,我们的目标是利用 MLLM 来实现高效的视频理解。我们提出了 ProVCA,一种渐进式视频压缩代理,可以在多个粒度上迭代地定位关键视频帧。 ProVCA 首先采用片段定位模块来识别与查询相关的视频片段,然后采用片段选择模块根据相似性选择重要片段,最后采用关键帧细化模块来精确定位这些片段中的特定关键帧。通过逐步将范围从粗片段缩小到精细帧,ProVCA 为基于 MLLM 的推理识别一小组关键帧。 ProVCA 在 EgoSchema 上实现了最先进的零样本精度 69.3\%,在 NExT-QA 上实现了 80.5\%,在 IntentQA 上实现了 77.7\%,同时使用的帧数比以前的 无需训练 方法更少。