论文
内存作为受控进程:LLM 代理的学习自适应内存管理
Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
摘要
大语言模型 (LLM) 代理越来越依赖外部存储系统来积累跨任务的经验。然而,几乎所有现有的方法,从图形结构记忆到反思性洞察存储,都是通过固定的、手工设计的启发式访问记忆。我们认为,这种静态的记忆观是主体学习的核心瓶颈,因为最佳记忆行为从根本上来说是依赖于上下文的。由于内存稀疏,任务的早期阶段可以从最少的检索中受益;重复目标类型受益于计划重用,而不是通用的最近邻查找;陷入困境的代理可以从使用替代查询的重新检索中受益;在长任务流中,内存存储本身必须进行整合和修剪才能保持有用。我们将内存作为受控过程(MemCon),这是一个将内存操作建模为马尔可夫决策过程的框架,并学习在线策略,自适应地决定何时检索、检索内容和检索多少,何时注入精炼计划,以及何时巩固或忘记。 MemCon 与后端无关:它包装任何现有的内存实现,从逐个任务的二进制反馈中学习,无需预训练,也无需额外的 LLM 调用,并使用轻量级表格上下文老虎机和 UCB 探索,在数十个任务中收敛。在 6 个基准测试、3 个代理框架和 3 个 LLM 主干中,MemCon 在任务成功率方面始终优于多个内存基准高达 15.2 个点,同时减少了 5--20% 的词元消耗。