论文

Response-G1:用于主动流媒体视频理解的显式场景图建模

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

上下文与知识知识图谱

摘要

主动的流媒体视频理解需要 Video-LLM 决定何时在视频展开时做出响应,而现有方法由于其隐式的、与查询无关的视觉证据建模而经常无法完成这项任务。我们引入了 Response-G1,这是一种新颖的框架,它通过场景图在积累的视频证据和查询的预期响应条件之间建立明确的、结构化的对齐。该框架在三个无 微调 的阶段运行:(1)从流剪辑生成在线查询引导的场景图; (2)基于记忆的语义最相关的历史场景图的检索; (3)检索增强触发提示每帧“沉默/响应”决策。通过将证据和条件建立在共享图形表示中,Response-G1 实现了更可解释和更准确的响应时间决策。已建立基准的实验结果证明了我们的方法在主动和被动任务中的优越性,验证了显式场景图建模和检索在流视频理解中的优势。