论文

Memory-R2:长期记忆增强 LLM 代理的公平贡献分配

Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents

模型训练强化学习

摘要

内存增强型 LLM 代理通过跨会话存储、更新和重用信息,实现超越有限上下文窗口的交互。然而,在多会话环境中通过强化学习来训练此类代理具有挑战性,因为记忆将代理过去的行为转变为其未来环境的一部分。一旦不同的部署写入、更新或删除不同的内存,它们就不再共享相同的中间内存状态,从而使轨迹级比较从根本上变得不公平。这违反了 GRPO 等与组相关的方法背后的一个关键假设,其中对采样轨迹进行比较,就好像它们是从相同的有效环境中采样一样。因此,轨迹级奖励为长期记忆操作提供了嘈杂或有偏见的信用信号。为了应对这一挑战,我们引入了 Memory-R2,这是一种用于长视野记忆增强 LLM 代理的训练框架。其核心算法LoGo-GRPO结合了局部和全局组相关优化。全局目标保留了来自长视野轨迹级奖励的端到端学习,而局部重新部署则比较同一中间记忆状态的不同记忆操作结果,从而产生更公平的组比较和对记忆构建更精确的监督。除了学分分配之外,Memory-R2 通过共享参数共同学习设计共同优化记忆形成和记忆演化,其中事实提取器和记忆管理器通过特定于角色的提示从同一 LLM 主干进行实例化。为了在长记忆范围内稳定多步强化学习,我们采用渐进式课程,将训练范围从 8 节增加到 16 节,再增加到 32 节。这些组件共同为长视野多会话设置中的记忆增强 LLM 代理提供了有效的训练范例。