论文
备忘录:长期 LLM 特工的多模式证据记忆组织
MEMO: Multimodal Evidence Memory Organization for Long-Horizon LLM Agents
摘要
长时间运行的 LLM 代理依赖外部存储器来存储和重用单个上下文窗口之外的信息,但交互轨迹的持续积累与有限的上下文容量之间存在根本性的紧张关系。因此,智能体记忆的关键挑战不仅是检索相关记录,而且是在给定预算下选择必要的证据并以适当的方式组织它。现有的记忆读出方法主要采用文本或视觉形式。文本保留了高保真度,但其线性标记表示使得不同重要性的内容以几乎统一的单位成本竞争有限的上下文。视觉读出将文本渲染成类似文档的图像,可以使用二维布局来暴露结构并强调关键信息,但在渲染和压缩过程中可能会丢失细粒度的细节。为了解决这个问题,我们提出了 MEMO,一种用于 LLM 代理的多模式证据记忆组织方法。 MEMO首先使用经过训练的证据提取器来选择相关的记忆块并形成具有源信息和呈现要求的证据单元。经过训练的查询条件内存管理器将每个单元分配给文本、视觉或双通道载体,并选择与证据结构相匹配的布局。然后,确定性内存构建模块生成文本包和视觉页面。内存管理器依据离线阅读器的反馈训练,该离线阅读器测量引导内存计划的效用,以便保留和呈现决策与下游使用保持一致。我们在四个基准测试(HotpotQA、2WikiMultiHopQA、LoCoMo 和 ALFWorld)上评估 MEMO,并具有多个阅读器后端。结果表明,MEMO 以更少的内存标记更有效地呈现内存,提高下游任务性能,并在有限的预算下构建更有效的工作记忆。