论文
我们准备好采用代理本机内存系统了吗?
Are We Ready For An Agent-Native Memory System?
摘要
大语言模型 (LLM) 代理的内存已从简单的检索增强机制迅速发展为数据管理系统,支持整个代理执行过程中的持久信息存储、检索、更新、整合和动态生命周期治理。尽管发生了这种演变,现有的评估仍然主要通过端到端任务成功指标(例如 F1、BLEU)来对代理内存进行基准测试,同时将底层系统视为整体黑匣子。因此,关键的系统级问题,包括运营成本、跨内存模块的架构权衡以及动态知识更新下的鲁棒性,仍然没有得到充分探讨。在本文中,我们从数据管理的角度对代理内存进行了系统的实验研究。我们提出了一个分析框架,将代理内存分解为四个核心模块:内存表示和存储、提取、检索和路由以及维护。在此框架下,我们评估了 12 个代表性内存系统和跨 11 个数据集的 5 个基准工作负载的两个参考基线。我们广泛的端到端评估表明,没有一种架构能够在所有场景中占据主导地位。相反,有效性在很大程度上取决于内存结构与工作负载瓶颈的匹配程度。此外,通过细粒度的消融研究,我们量化了它们对表示保真度、检索精度、更新正确性和长期稳定性的个体影响。最后,我们揭示了实际工作负载下的成本性能权衡,表明本地维护比全球重组更具成本效益。基于这些发现,我们确定了构建真正的代理本机记忆系统的有希望的方向。该代码可在 https://github.com/OpenDataBox/MemoryData 上公开获取。