论文

视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

上下文与知识记忆Agent记忆

摘要

长视频理解需要的不仅仅是大的上下文窗口。它还需要一种记忆机制来决定保留哪些视觉证据,使其在长期范围内可搜索,并以可恢复的观察结果为基础进行稍后的推理,而不仅仅是压缩的潜在状态。我们提出视觉代理记忆(VAM),一个具有三个组件的 无需训练 框架。在线索引支持在流限制下选择性保留证据。分层记忆以并行表示形式组织保留的证据,使时间背景与空间观察保持一致。代理检索在产生有根据的答案之前搜索、检查和验证候选证据。在 OVO-Bench 上,VAM 在所有报告的基线中实现了最高的 RT+BT 平均值 (68.41),优于相同底层 MLLM 的端到端使用(Gemini 3 Flash,67.46)。在 MM-Lifelong train@month 的月尺度分割上(51 天 105.6 小时),VAM 达到 17.11%,仅次于 ReMA 和 GPT-5(17.62%)。这些结果表明,将视觉记忆视为明确的、可检查的和可查询的基质可以使长视距视频理解受益。代码可在 https://github.com/yiliu-li/Visual-Agentic-Memory 获取。