论文

Mem-$π$:通过学习何时生成以及生成什么来实现自适应记忆

Mem-$π$: Adaptive Memory through Learning When and What to Generate

上下文与知识记忆Agent记忆

摘要

我们提出了 Mem-$π$,这是 大语言模型 (LLM) 代理中的自适应记忆框架,其中有用的指导是按需生成的,而不是从外部记忆存储中检索。现有的记忆增强代理通常依赖于从情景记忆库或技能库中基于相似性的检索,返回通常与当前上下文不一致的静态条目。相比之下,Mem-$π$ 使用具有自己的参数的专用语言或视觉语言模型,与下游代理分开,为复杂任务生成特定于上下文的指导。根据当前代理上下文,该模型共同决定何时生成指导以及生成什么指导。我们使用决策内容解耦的强化学习 (RL) 目标来训练它,使其能够在生成无济于事时放弃,否则会产生简洁、有用的指导。在涵盖网络导航、基于终端的工具使用和基于文本的体现交互的各种代理基准中,Mem-$π$ 始终优于基于检索和先前的 RL 优化的内存基线,在网络导航任务上实现了超过 30% 的相对改进。