论文
从玩家到大师:通过记忆强化学习增强 LLM 代理的测试时学习
From Player to Master: Enhancing Test-Time Learning of LLM Agents via Reinforcement Learning over Memory
摘要
大语言模型 (LLM) 代理越来越多地部署在长期运行的环境中,在这些环境中,通过测试时的体验进行改进变得非常重要。一种常见的方法是在每次交互后更新外显记忆以指导未来的决策。然而,大多数现有方法依赖于手工设计的提示规则,使得很难在多步骤范围内一致地将内存更新与下游目标保持一致。我们提出了 MemoPilot,一个插件内存副驾驶,它显式地训练内存更新过程,以提高冻结的 LLM 在顺序交互中的性能。我们将内存更新表述为多轮决策问题,并使用多轮 GRPO 对其进行端到端优化。我们的训练方案引入了(i)回合奖励信号和(ii)跨执行轨迹的上下文独立的回合级优势估计,从而在多回合设置中实现更细粒度的贡献分配和更稳定的训练。我们在两个测试平台上评估 MemoPilot:多轮剪刀石头布 (RPS) 和限注德州扑克 (LHE)。在这两种环境中,MemoPilot 在强大的基线上显着改善了冻结玩家的测试时学习,在两种游戏的 Elo 评级中排名第一(LHE 为 1762,RPS 为 1590),并且优于所有基线记忆方法和专有模型,包括 DeepSeek-V3.2。