论文
Agent记忆系统的跨场景泛化:问题诊断与强基线
Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline
摘要
LLM 代理积累的历史超出了其上下文窗口的范围,从而激发了有关记忆系统的文献不断增长。然而,大多数现有设计都是针对单一场景(多会话聊天或单一轨迹格式)进行调整,并且几乎没有证据表明它们可以概括代理在部署中遇到的异构轨迹。我们在五个场景中重新审视了八个记忆系统以及用于搜索问题的代理工具:单轮 QA、多会话聊天、代理轨迹 QA、内存压力测试和长期代理任务。该工具通过工具调用自行管理平面文本文件存储,实现了最佳的跨任务排名,这表明内存性能取决于为代理提供对存储和检索的主动控制,而不是固定管道后面的被动存储。我们在 AutoMEM 中实例化了这一见解,这是一种具有自我管理工具接口的代理内存工具,可在我们评估的系统中实现最佳的跨场景通用性。