论文

CAM:通过连续提取和自适应查询对以实体为中心的视频进行问答

CAM: Question Answering on Entity-Centric Videos with Continuous Extraction and Adaptive Querying

摘要

记忆通过提取和检索事实以适应多模式 LLM (MLLM) 的有限上下文窗口,有助于在长视频上回答问题。现有的解决方案通常从固定长度的视频剪辑中提取独立的内存条目,因此无法捕获需要在较长时间段内总结的高级语义,例如角色特征和关系。此外,它们仅依赖于基于相似性的检索,可能无法检索回答问题所需的细粒度细节。为了解决这些问题,我们提出了 CAM,其特点是连续提取高级语义和自适应查询细粒度细节。特别是,CAM将从视频剪辑中提取的实体和关系存储在知识图中。为了捕获每个实体或关系的高级语义,一旦子图达到预定义的大小,CAM 就会总结目标实体或关系的局部子图。为了检索问答所需的细粒度细节,CAM 支持多种搜索方法,包括知识图谱遍历、视频重看和音频收听。它利用规划器-执行器-验证器管道根据问题意图自适应地组合这些搜索方法。对三个基准的评估表明,CAM 的性能优于 SOTA 基准,并将其准确性提高了多达 23 个百分点。代码可在 https://github.com/Jake-Tian/CAM 获取。