论文

MemArbiter:长程LLM Agent在决策时仲裁记忆

MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents

上下文与知识记忆Agent记忆

摘要

大语言模型(LLM)代理必须保留和使用跨步信息,以便在长时滞任务中保持一致的行为。现有的方法虽然提高了记忆的可访问性,但仍然存在行动相关的信息未能引导当前决策的问题,因为这些信息可能不清晰、组织不当、优先级不明确或呈现方式不当。我们称之为记忆-行动差距。我们提出MemArbiter,这是一种功能-aware的记忆仲裁框架,旨在解决这个差距中的记忆管理部分。MemArbiter将交互历史分解为原子项,组织成五个功能性的记忆银行,并结合银行级别的需求、项级别的相关性、焦点-背景表示和时间呈现门控,动态控制记忆的重要性。我们在统一的每步记忆预算下,与Flat Retrieval和Flat Recency进行比较,使用开放权重的动作生成模型,MemArbiter在500-和750个词元预算下取得了82.8%和92.5%的成功率,分别超越了最强的基准20.9和25.4个百分点。此外,它还提高了失败后的恢复和减少了失败动作重复和状态-动作重复。这些结果表明,功能-aware的记忆仲裁使可访问的信息能够更有效地引导行动。

MemArbiter:长程LLM Agent在决策时仲裁记忆:论文配图
图1 :一个案例,说明了由平面记忆组织引起的记忆-动作间隙。尽管有相关的记忆,但扁平的组织混合了异质的记忆,削弱了他们的行动影响力。功能感知内存组织通过决策函数分离内存,为长视野代理构建结构化上下文。