论文
VideoTapestry:查询自适应记忆细化,用于多智能体长视频理解
VideoTapestry: Query-Adaptive Memory Refinement for Multi-Agent Long-Video Understanding
摘要
长视频理解对记忆提出了很高的要求,因为回答问题通常需要检索分布在扩展时间跨度上的信息。现有方法大致遵循两种范式:查询驱动的探索(对本地化错误敏感)和独立于查询的记忆构造(可能会省略特定于问题的细节)。我们介绍 VideoTapestry,这是一个无需训练多智能体框架,它通过从粗到细、查询驱动的细化来适应预构建的分层视频记忆。预先构建的记忆将视频内容组织为三个级别,分别捕获全局叙事上下文、事件级时间结构和细粒度关系证据。为了支持从粗到细的定位和观察,我们为每个级别分配一个专门的智能体,从而在特定于尺度的上下文中保持检索和细化。在查询的引导下,这些智能体重新访问相关视频区域,并通过有针对性的多模态观察丰富分层记忆。它们的改进根据原始层次结构组装成复合查询自适应记忆,以紧凑的形式保留全局上下文,同时保留沿着查询相关分支的细粒度证据以进行最终推理。与直接 GPT-5.5 推理相比,VideoTapestry 在 LVBench、LongVideoBench (Long)、Video-MME (Long) 和 EgoSchema 上分别实现了 17.2%、14.9%、9.8% 和 7.0% 的绝对准确度增益,在所有竞争对手中取得了最先进的结果。
