论文
事件因果RAG:面向复杂场景长视频推理的检索增强生成框架
Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios
摘要
最近的大型视觉语言模型在中短视频理解方面取得了很强的性能,但它们仍然不足以进行超长甚至无限的视频推理,其中模型必须在较长的时间内保持连贯的记忆并推断跨时间遥远事件的因果依赖性。现有的端到端视频理解方法从根本上受到自注意力复杂度 O(n^2)$ 的限制,而最近的检索增强生成 (RAG) 方法仍然受到片段级内存碎片、时间和因果结构建模弱以及存储和在线推理成本高的困扰。我们提出了事件因果 RAG,这是一种用于无限长视频推理的轻量级检索增强框架。我们的方法不是索引固定长度的剪辑,而是将流视频分割成语义一致的事件,并将每个事件表示为结构化的状态-事件-状态(SES)图,捕获事件及其周围的状态转换。这些图被合并成全局事件知识图并存储在支持语义匹配和因果拓扑检索的双存储存储器中。在此记忆之上,我们设计了一种双向检索策略,以有效识别最相关的事件因果链,并将它们与相关的视频证据一起提供给骨干视频基础模型以生成答案。长视频理解基准的实验表明,事件因果 RAG 始终优于强大的基于剪辑的检索基线和长上下文视频模型,特别是在需要跨长时间间隙进行多事件集成和因果推理的问题上,同时还实现了更高的内存效率和强大的流性能。
