论文
VideoStir:通过时空结构和意图感知 RAG 理解长视频
VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
摘要
将多模态 大语言模型 (MLLM) 扩展到长视频受到有限的上下文窗口的限制。虽然检索增强生成(RAG)通过将与查询相关的视觉证据组织到紧凑的上下文中是一种很有前途的补救措施,但大多数现有方法(i)将视频扁平化为独立的片段,打破了其固有的时空结构,以及(ii)依赖于显式语义匹配,这可能会错过与查询意图隐式相关的线索。为了克服这些限制,我们提出了 VideoStir,一种结构化且意图感知的长视频 RAG 框架。它首先将视频构建为剪辑级别的时空图,然后执行多跳检索以聚合遥远但上下文相关事件的证据。此外,它还引入了 MLLM 支持的意图相关性评分器,该评分器根据帧与查询推理意图的一致性来检索帧。为了支持此功能,我们策划了 IR-600K,这是一个专为学习框架查询意图对齐而定制的大型数据集。实验表明,VideoStir 在不依赖辅助信息的情况下与最先进的基线具有竞争力,凸显了将长视频 RAG 从扁平化语义匹配转变为结构化、意图感知推理的前景。代码和检查点可在 https://github.com/RomGai/VideoStir 上找到。