论文

记忆何时有用?工具型Agent长期记忆的成本效益评测

When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

如今,LLM 智能体的长期记忆通过对话回忆基准(LoCoMo、LongMemEval)进行评估,该基准衡量对话历史中的问题回答,而不是记住的事实是否会改变使用工具的智能体的行为。我们提出了 MERIT(现实仪器任务的记忆评估),这是一个基准和工具,用于测量显式成本核算下任务执行智能体的记忆边际效用。 MERIT 在三个领域提供情景工具使用任务,这些任务对早期情景的依赖通过自动泄漏检查进行验证;以更新事实回忆结束的难度阶梯;受控记忆损坏;每个记忆操作的完整Token和美元计量。在 23,440 个评分剧集(42.57 美元)中,gpt-4.1-mini 上的两代飞行员和预先注册的 3 模型 x 3 种子网格(GPT-4.1,Claude Haiku 4.5;记忆侧固定),记忆将依赖任务成功率从 0.00 的泄漏验证下限提升到 0.55-1.00。对于更新的事实,嵌入检索会不可预测地崩溃(跨模型为 0.30-0.95;最大种子间隙为 0.45),并且智能体仅在 55% 的时间内对正确检索的值进行操作,而写入时更新存储(结构化事实存储,特别是 LLM 摘要)保持在 0.70-1.00;混合比单独的事实存储更糟糕。最新一代的抽查(Claude Sonnet 5,在干净的完整重放控制上门控)再现了该模式。交换记忆的实现可以使任务成功率提高多达 60 点,并且完全重放从来都不经济:每个域的最佳条件每美元可提供 2.7-3.9 倍的边际效用。我们发布了基准、工具和所有跟踪。

记忆何时有用?工具型Agent长期记忆的成本效益评测:论文配图
图 1:跨难度阶梯、每个记忆条件和域的相关任务 TSR(实际实现)。硬(更新事实)层将覆盖状态的记忆分开,即事实存储(C4),尤其是LLM摘要(C3),它会重写每个情节的摘要,以及按时间顺序重放(C1)和基于检索的记忆(C2,C5)。