论文

Light-Omni:利用长期记忆进行代理视频理解中的反射推理

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

智能体系统Agent 架构与控制循环

摘要

代理视频理解为模型配备了长期记忆,可以自主处理和响应连续的、长视野的多模式流。然而,高级视频代理通常依赖于“侦探式”迭代推理来进行动作控制(例如,$\mathtt{search}$)和证据聚合,从而导致高昂的成本和延迟。我们认为,这种沉重的推理主要弥补了检索中全局上下文的缺乏和语义错位。本文介绍了 Light-Omni,这是一个用于反射性和轻量级视频理解的多模式代理框架。它通过双重上下文状态来实现这一点,在一次前向传递中立即构建所需的上下文。首先,我们维护一个全局状态,一个从情景记​​忆中不断整合的有限大小的多模态脚本,作为 Light-Omni 的全局上下文。通过分层合并,它在总结过去事件的同时保留了最近的细节。其次,以这种全局背景为条件,我们生成一个参数化潜在状态,它直接驱动自主动作并产生检索嵌入,并且延迟最小。受益于这种耦合设计,Light-Omni 实现了语义对齐的检索和反射响应,同时避免了迭代推理。大量实验验证了 Light-Omni 在多个视频基准中的有效性。值得注意的是,它的性能优于 M3-Agent,平均准确度提高 2.4%,加速提高 12.1$\times$,GPU 内存效率提高 2.6$\times$。此外,它还可以作为内存系统来增强现有 MLLM 的性能和效率。项目页面:https://clare-nie.github.io/Light-Omni。