论文

MemHarness:记忆是被重构的,而非重放的

MemHarness: Memory Is Reconstructed, Not Replayed

上下文与知识模型训练强化学习记忆RLVRAgentic RLAgent记忆

摘要

检索过往经验已成为增强大语言模型智能体的常见策略。然而,大多数现有记忆增强智能体将检索到的经验当作逐字重放的静态记录,不论其是否与智能体当前处境相符便注入上下文。这种“重放”范式忽视了存储经验的抽象、通用属性与决策时所面对的具体、不断变化的状态之间的鸿沟,常常导致负迁移。相比之下,人类很少逐字回忆过往经验,而是重组并调整检索到的记忆以适应当前情境。受此启发,我们提出 MemHarness,一个让 LLM 智能体能够基于当前情境主动驾驭并重构过往经验的框架。在每个决策步骤,统一的策略模型以当前状态为条件,对检索到的经验进行批判与重构,在行动前生成扎根于上下文的指引。这种重构能力通过 GRPO 的端到端训练自然涌现。在 ALFWorld 和 WebShop 上的实验表明,MemHarness 大幅优于纯强化学习与静态记忆增强基线,并在分布外(OOD)场景中展现出很强的鲁棒性。此外,我们的分析显示,这一重构目标不仅防止负迁移,还在训练过程中充当潜在指引,从根本上提升智能体自身的推理能力。

MemHarness:记忆是被重构的,而非重放的:论文配图
图 1:内存利用范例。上图:之前的方法直接重放检索到的记忆,存在状态错位的风险。中:人类记忆根据当前上下文重建过去的经验。底部:受此过程的启发,MemHarness 将检索到的记忆重建为状态对齐的指导。