论文

学习如何记忆以及记住什么:认知启发的两阶段优化记忆进化

Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory

模型训练上下文与知识强化学习记忆Agentic RLAgent记忆

摘要

大语言模型 (LLM) 代理需要长期的用户记忆来实现一致的个性化,但有限的上下文窗口阻碍了跟踪长时间交互中不断变化的偏好。现有的记忆系统主要依赖于静态的、手工制定的更新规则;尽管基于强化学习(RL)的智能体可以学习记忆更新,但稀疏的结果奖励提供的监督较弱,导致长期优化不稳定。借鉴记忆图式理论以及前额叶区域和海马区域之间的功能划分,我们引入了 MemCoE,这是一种受认知启发的两阶段优化框架,可以学习如何组织记忆以及更新哪些信息。在第一阶段,我们提出记忆指南归纳,通过解释为文本梯度的对比反馈来优化全局指南;在第二阶段,指南对齐记忆策略优化使用诱导指南来定义结构化过程奖励,并执行多轮强化学习以学习遵循指南的记忆进化策略。我们评估了三个个性化记忆基准,涵盖显式/隐式偏好以及不同的大小和噪声,并观察到相对于强基线的一致改进,具有良好的鲁棒性、可转移性和效率。