论文

智能体记忆:有状态长程LLM智能体的表征与系统含义

Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads

模型评测上下文与知识上下文工程记忆评测方法与指标Agent记忆

摘要

LLM 代理越来越多地部署在需要对长期交互历史进行持续推理的长期任务上。大规模实现这一点需要代理跨会话持久存储、检索和更新自己的内存。丰富的智能体记忆系统生态系统已经出现,涵盖平面检索、LLM 介导的提取、整合事实存储和智能体控制流。然而,它们的系统级行为仍然没有特征。我们提出了代理记忆的第一个系统特征。首先,我们引入一种面向系统的分类法,沿四个轴对代理内存系统进行分类。其次,我们构建了一个阶段感知分析工具,将成本归因于构建、检索和生成。第三,我们描述了两个基准套件中的十个代表性系统的特征,揭示了设计选择如何在写入和读取路径上转移成本。最后,我们得出 10 条系统建议,涵盖施工调度、能力底线、查询量摊销、新鲜度-延迟权衡和车队规模管理。

智能体记忆:有状态长程LLM智能体的表征与系统含义:论文配图
图 7:(a) 构建-服务-准确性边界。快速构建、快速每次查询服务和高精度无法共同最大化。准确性和成本是所有 MemoryAgentBench 数据集(远程服务、GPT-4o-mini、text-embedding-3-small)的宏观平均。 (b) 代理内存系统在 MemoryAgentBench 套件中各种任务类别上的性能。