论文

当历史是多模态时:重新思考长期代理的上下文管理

When History Is Multimodal: Rethinking Context Management for Long-Horizon Agents

上下文与知识上下文工程

摘要

长视野智能体需要一个上下文管理器,通过决定如何访问和重组内存的被动策略或主动策略,将不断增长的交互历史压缩到有界的工作上下文中。与此同时,先前的光学记忆工作主要将像素视为文本化历史的密集编解码器,通常假设将上下文渲染到光学记忆中会导致相对于文本的显着性能下降,因此将这种表示与SFT、self-蒸馏或强化学习结合起来以缩小这一差距,但未解决的问题是:(i)视觉渲染如何在公平、受控的比较下作为上下文管理器执行,以及(ii)当历史本质上是多模态时,该载体是否提供天然优势。在本文中,我们将上下文管理制定为预算受限的历史转换,并引入视觉渲染(VR)作为代表性上下文管理器。在共享的工具、策略模型、触发器和任务域下,我们根据四个以文本为中心的基准和三个多模式基准,对照四个基线(无压缩、全部丢弃、滑动窗口、摘要)来评估 VR,发现视觉记忆是本地视觉证据的自然载体。基于这一发现,我们提出了 VERA(长视野代理的视觉证据保留策略),这是一种基于确定性渲染而构建的 无需训练 上下文管理器,没有暴露的内存操作:在以文本为中心的基准测试上,它像 VR 一样渲染文本历史,而在多模式基准测试上,它保留本机视觉观察结果,而不是将其转换为文本。在几乎所有基准测试中,VERA 与无压缩相比,将累积非缓存词元减少了 31.5%-63.1%,在以文本为中心的任务上与现有管理器相匹配,并在多模式任务的所有基准中实现了最高的准确性,支持长范围上下文管理的模态保留视图。