论文

先上图吧!通过场景图对长篇自我中心视频进行推理

Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs

上下文与知识知识图谱

摘要

由于严格的输入词元限制,现有的多模态 大语言模型 (MLLM) 在处理长视频序列时面临重大挑战。因此,当前的视频理解方法,特别是在以复杂动态、频繁状态变化和移动摄像机为特征的以自我为中心的环境中,被迫对帧进行大规模子采样。这导致时间和上下文信息的严重丢失,限制了他们执行细粒度视频推理的能力。在这项工作中,我们引入了一个以自我为中心的视频问答(VQA)框架,该框架通过以自我为中心的场景图(EgoSG)克服了这些输入限制,即随时间变化捕获对象、属性、空间关系和交互的基于时间的结构化表示。通过将视频表示为紧凑的、基于文本的场景图,我们的方法以符号形式保留了原始视频的基本视觉和时间信息,从而大大减少了输入长度,同时保持了语义丰富性。至关重要的是,这使得 MLLM 能够对其 词元预算 内的整个视频序列进行高效推理。在 HD-EPIC VQA 上,我们的方法实现了最先进的结果,在多个模型上优于基于视频的强大基线,并表明像 EgoSG 这样的结构化、基于时间的表示可以弥合长形式的以自我为中心的视频理解和当今 MLLM 的上下文限制。