论文
AMA-Bench:评测 Agentic 应用的长程记忆
AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications
摘要
大语言模型 (LLM) 在日益复杂的应用程序中被部署为自主代理,其中启用长视野内存对于实现强大的性能至关重要。然而,实际应用与当前智能体记忆评估标准之间存在显着差距:现有基准主要关注以对话为中心的人与智能体交互。实际上,代理记忆由代理与环境交互的连续流组成,这些交互主要由机器生成的表示组成。为了弥补这一差距,我们引入了 AMA-Bench(任意长度的代理内存),它可以评估真实代理应用中 LLM 的长视野内存。它具有两个关键组成部分:(1) 一组跨代表性代理应用程序的真实代理轨迹,与专家策划的 QA 配对;(2) 一组可扩展到任意范围的合成代理轨迹,与基于规则的 QA 配对。我们的综合研究表明,现有的记忆系统在 AMA-Bench 上表现不佳,主要是因为它们缺乏因果关系和客观信息,并且受到许多记忆系统所采用的基于相似性的检索的有损性质的限制。为了解决这些限制,我们提出了 AMA-Agent,这是一种有效的记忆系统,具有因果关系图和工具增强检索功能。我们的结果表明,AMA-Agent 在 AMA-Bench 上的平均准确率达到 57.22%,比最强的内存系统基线高出 11.16%。
