论文

桥接模式,跨越时间:用于超长代理视频推理的结构化记忆

Bridging Modalities, Spanning Time: Structured Memory for Ultra-Long Agentic Video Reasoning

摘要

理解超长视频,例如以自我为中心的录音、直播或持续数天到数周的监控录像,仍然是一个挑战。对于当前的多模态 LLM:即使具有百万个词元上下文窗口,帧预算也仅覆盖数十分钟的密集采样视频,并且大多数证据在推理开始之前就被丢弃。记忆增强和代理方法有助于扩大规模,但它们的检索在不同模式中仍然是碎片化的,并且缺乏跨越数天或数周的长期叙述摘要。我们提出 \textbf{MAGIC-Video},这是一个围绕具有交错叙事链的多模态记忆图构建的 无需训练 框架:该图通过六种类型的边统一情景、语义和视觉内容并支持跨模态检索,而该链则提炼出长期实体传记和重复活动事件。在推理时,代理循环将图检索与叙述事实注入交织在一起,在单个检索管道中涵盖超长视频的模态和时间维度。在 EgoLifeQA、Ego-R1 和 MM-Lifelong 上,MAGIC-Video 始终优于强大的通用、长视频和代理基线,在每个基准测试中比之前最好的代理系统分别提高了 10.1、7.4 和 5.9 分。代码可在 https://github.com/lijiazheng0917/MAGIC-video 获取。