论文
MemArbiter:长程LLM Agent在决策时仲裁记忆
MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents
摘要
大语言模型(LLM)代理必须保留和使用跨步信息,以便在长时滞任务中保持一致的行为。现有的方法虽然提高了记忆的可访问性,但仍然存在行动相关的信息未能引导当前决策的问题,因为这些信息可能不清晰、组织不当、优先级不明确或呈现方式不当。我们称之为记忆-行动差距。我们提出MemArbiter,这是一种功能-aware的记忆仲裁框架,旨在解决这个差距中的记忆管理部分。MemArbiter将交互历史分解为原子项,组织成五个功能性的记忆银行,并结合银行级别的需求、项级别的相关性、焦点-背景表示和时间呈现门控,动态控制记忆的重要性。我们在统一的每步记忆预算下,与Flat Retrieval和Flat Recency进行比较,使用开放权重的动作生成模型,MemArbiter在500-和750个词元预算下取得了82.8%和92.5%的成功率,分别超越了最强的基准20.9和25.4个百分点。此外,它还提高了失败后的恢复和减少了失败动作重复和状态-动作重复。这些结果表明,功能-aware的记忆仲裁使可访问的信息能够更有效地引导行动。
