论文
Auto-Dreamer:学习语言代理的离线记忆整合
Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents
摘要
语言代理越来越多地对相关任务流进行操作,但现有的记忆系统很难将积累的经验转化为可重用的知识。检索增强和结构化记忆方法可以有效地记录每个会话的观察结果,但通常将获取和整合结合到一个在线过程中,使代理无法跨会话进行全局视图来发现重复出现的模式、抽象共享过程或修剪冗余条目。受互补学习系统理论的启发,我们提出了 Auto-Dreamer,一种用于语言代理记忆的学习离线巩固器。 Auto-Dreamer 将快速的每会话内存获取与缓慢的跨会话整合分开。给定类型化存储库的选定工作区域,合并器将该区域视为只读证据,执行有界工具使用来检查条目和与出处相关的源轨迹,并合成一个新的紧凑替换集,该替换集跨会话抽象并取代原始区域。我们通过 GRPO 训练 Auto-Dreamer,使用端到端代理性能作为奖励信号,学习如何巩固通过快速在线体验获得的记忆。仅在 ScienceWorld 轨迹上进行训练,Auto-Dreamer 的性能优于 ScienceWorld 上的固定、强化学习和提示记忆基线 7 个点,同时使用比最强基线小 12$\times$ 的主动记忆库,并且在不进行重新训练的情况下继续在保留的 ALFWorld 和 WebArena 上领先 - 使用比 ALFWorld 上最强基线少 6$\times$ 的内存。