论文

VideoTapestry:查询自适应记忆细化,用于多智能体长视频理解

VideoTapestry: Query-Adaptive Memory Refinement for Multi-Agent Long-Video Understanding

摘要

长视频理解对记忆提出了很高的要求,因为回答问题通常需要检索分布在扩展时间跨度上的信息。现有方法大致遵循两种范式:查询驱动的探索(对本地化错误敏感)和独立于查询的记忆构造(可能会省略特定于问题的细节)。我们介绍 VideoTapestry,这是一个无需训练多智能体框架,它通过从粗到细、查询驱动的细化来适应预构建的分层视频记忆。预先构建的记忆将视频内容组织为三个级别,分别捕获全局叙事上下文、事件级时间结构和细粒度关系证据。为了支持从粗到细的定位和观察,我们为每个级别分配一个专门的智能体,从而在特定于尺度的上下文中保持检索和细化。在查询的引导下,这些智能体重新访问相关视频区域,并通过有针对性的多模态观察丰富分层记忆。它们的改进根据原始层次结构组装成复合查询自适应记忆,以紧凑的形式保留全局上下文,同时保留沿着查询相关分支的细粒度证据以进行最终推理。与直接 GPT-5.5 推理相比,VideoTapestry 在 LVBench、LongVideoBench (Long)、Video-MME (Long) 和 EgoSchema 上分别实现了 17.2%、14.9%、9.8% 和 7.0% 的绝对准确度增益,在所有竞争对手中取得了最先进的结果。

VideoTapestry:查询自适应记忆细化,用于多智能体长视频理解的原论文方法或结果图
图 2:VideoTapestry 概述。比例对齐的智能体在预先构建的分层视频记忆上运行,而分层工具增强细化有选择地合并不同语义级别上新获取的查询相关观察结果。由此产生的细化层记忆分层组装成复合查询自适应记忆以进行最终预测。