论文

VideoLoop:循环工作记忆对抗长视频Agent中的语义抖动

VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents

上下文与知识上下文工程

摘要

长视频理解需要多模态Agent通过许多推理步骤迭代收集证据。然而,大多数现有的 Agentic 方法都遭受语义颠簸:随着仅附加工作记忆的增长,对关键证据的注意力崩溃,并且Agent无法访问其已发现的内容。首先,我们提供了一个结构论点,表明仅附加内存可以合并新观察到的目标证据,但无法消除累积的噪声或在没有重写运算符的情况下阻止有序上下文增长。其次,受此分析的启发,我们提出了 VideoLoop,一种具有两个耦合循环的多模态Agent。外循环对视频进行推理,内循环在每个步骤之后从过去观察和中间分析的无界文件系统中检索工件,并重写有界工作内存。大量实验证明了 VideoLoop 的有效性,它以即插即用的方式改进了四种流行的 LVLM 主干网,在 VideoMME(长)上的平均增益比基线提高了 4.2%。对工作记忆的进一步分析表明,VideoLoop 减轻了语义颠簸:在 VideoMME(长)问题中最难的四分之一中,仅读取Agent上下文的盲目判断正确回答了 81.1%,而仅附加Agent的正确率是 60.9%。使用 Gemini 3.1 Pro,VideoLoop 在 VideoMME(长)上达到 88.3%,在 VideoMMMU 上达到 88.8%,在 LongVideoBench(长)上达到 80.9%。