论文
图到帧 RAG:无需训练 的视觉空间知识融合和可审核视频推理
Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning
摘要
当视频推理需要外部知识时,许多具有大型多模态模型 (LMM) 的系统会采用检索增强来提供缺失的上下文。然而,附加文本或多剪辑证据会迫使异构信号进入单一注意力空间。即使在非长视频中,我们也观察到注意力分散和认知负荷较高。瓶颈不仅在于检索什么,还在于如何表示外部知识并将其与视频主干融合。我们提出了图到帧 RAG (G2F-RAG),这是一种在视觉空间中提供知识的 无需训练 和可审计范式。在离线阶段,代理构建一个与问题无关的视频知识图,集成了实体、事件、空间关系和链接的世界知识。在在线阶段,分层多智能体控制器决定是否需要外部知识,检索最小的充分子图,并将其渲染为附加到视频的单个推理帧。然后,LMM 在统一的视觉域中执行联合推理。这种设计减少了认知负荷,并留下了明确的、可检查的证据线索。G2F-RAG 是跨主干网和规模的即插即用型。它在不同的公共基准上产生了持续的收益,在知识密集型环境中取得了更大的进步。消融进一步证实了知识表示和交付很重要。 G2F-RAG 将检索重新构建为视觉空间知识融合,以实现稳健且可解释的视频推理。