论文
EC-RAG:以事件链检索理解长视频
EC-RAG: Event Chain Retrieval-Augmented Generation for Long Video Understanding
摘要
当前的大型视频语言模型(LVLM)在处理长视频时仍然面临挑战,主要是因为帧通常是独立处理的,因此很难捕获事件之间的时间依赖性。尽管已经引入了检索增强方法来提供额外的上下文,但它们大多数在框架或片段级别上运行,这限制了它们对事件如何随时间演变以及彼此关联进行建模的能力。在本文中,我们提出了事件链检索增强生成(EC-RAG),这是一种 无需训练框架,可在回答问题之前将视频内容组织成显式事件链。 EC-RAG 不是检索孤立的帧或文本片段,而是首先将视频划分为语义一致的片段,使用多模态信号表示每个片段,然后将它们链接到保留时间顺序并捕获事件间关系的结构化链中。给定一个查询,系统会识别该链中的相关事件,并从相关模式中收集支持证据。我们的方法提供了几个实际优势:(i)事件级抽象可以更好地反映视频内容的自然结构,与帧级检索相比,可以实现更可靠的本地化; (ii) 结构化多模态融合,在事件层面聚合语音、文本和视觉线索,允许在推理过程中更有效地利用补充信息; (iii) 与现有 LVLM 骨干模型 的即插即用兼容性,无需额外的训练或依赖专有模型。 Video-MME、MLVU 和 LongVideoBench 上的实验表明,这种以事件为中心的设计始终优于帧级检索基线,凸显了时间结构建模对于长视频理解的重要性。
