论文

MemPO:面向长时程智能体的自记忆策略优化

MemPO: Self-Memory Policy Optimization for Long-Horizon Agents

模型训练上下文与知识强化学习记忆Agentic RLAgent记忆

摘要

长视野智能体在与环境交互过程中面临着上下文大小不断增长的挑战,这会降低性能和稳定性。现有方法通常引入外部内存模块并从存储的内存中查找相关信息,这阻止了模型本身主动管理其内存内容并与代理的总体任务目标保持一致。为了解决这些限制,我们提出了自记忆策略优化算法(MemPO),该算法使代理(策略模型)能够在与环境交互过程中自主总结和管理其记忆。通过改进基于记忆有效性的贡献归因机制,策略模型可以选择性地保留关键信息,在保持任务性能的同时显着减少token消耗。大量实验和分析证实,MemPO 的绝对 F1 分数比基本模型提高了 25.98%,比之前的 SOTA 基线提高了 7.1%,同时减少了 67.58% 和 73.12% 的token使用量。

MemPO:面向长时程智能体的自记忆策略优化
图1:我们方法的自我记忆推理过程,仅使用上一步的交互,并通过 <mem> 动作作为下一步的输入。