LongMemEval-V2:针对经验丰富的同事评估长期代理记忆
LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues
摘要
长期记忆对于专门网络环境中的代理至关重要,其中成功取决于回忆界面功能、状态动态、工作流程和重复出现的故障模式。然而,现有的智能体记忆基准主要关注用户历史、短踪迹或下游任务成功,如何直接评估记忆系统是否有效地内化特定环境的体验仍然是一个悬而未决的问题。为了解决这一差距,我们引入了 LongMemEval-V2 (LME-V2),这是一个评估内存系统是否可以帮助智能体获得在定制环境中成为知识渊博的同事所需的经验的基准。 LME-V2 包含 451 个手动策划的问题,涵盖 Web 代理的五种核心记忆能力:静态回忆、动态状态跟踪、工作流程知识、环境陷阱和前提感知。问题与历史轨迹配对,其中包含多达 500 条轨迹和 1.15 亿个词元。我们使用上下文收集公式:记忆系统消耗历史轨迹并返回下游问答的紧凑证据。我们提出了一套两种内存方法:AgentRunbook-R,一种基于 RAG 的高效内存,具有用于原始状态观察、事件和策略注释的知识池;以及 AgentRunbook-C,它将轨迹存储为文件并调用 编码智能体 在增强沙箱中收集证据。实验表明,AgentRunbook-C 实现了最佳性能,平均准确率为 72.5%,优于最强的 RAG 基线 (48.5%) 和现成的 编码智能体 基线 (69.3%)。尽管性能提升显着,但基于 编码智能体 的方法具有很高的延迟成本。虽然 AgentRunbook-C 提高了准确性-延迟帕累托边界,但仍然存在很大的改进空间。总之,这些结果使 LME-V2 成为开发环境体验长期记忆系统的具有挑战性的测试平台。