论文

MemDreamer:通过分层图内存和代理检索机制解耦长视频理解的感知和推理

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

摘要

当前的视觉语言模型很难处理长达数小时的视频,因为处理全长视觉序列会导致令人望而却步的词元爆炸和注意力稀释。为了克服这个问题,我们引入 MemDreamer 来解耦感知和推理,将长视频理解转变为代理探索过程。作为一个即插即用的框架,它增量地传输视频以构建分层图存储器,这是一种用于语义抽象的自上而下的三层架构,以捕获时空和因果关系的基础图为锚定。在推理过程中,推理模型采用代理工具增强检索、导航层次结构、搜索节点以及通过观察-推理-行动循环遍历逻辑边。实验表明,MemDreamer 在四个主流基准测试中均取得了 SOTA 成绩,将与人类专家的差距缩小至仅 3.7 分。它将推理上下文窗口限制为仅完整上下文摄取的 2%,同时提供 12.5 个点的绝对准确度增益。此外,统计分析揭示了 VLM 的逻辑推理性能与长视频理解基准之间存在很强的正线性相关性,从而将代理能力扩展建立为多模态理解的新范例。