论文
ProcMEM:通过 LLM 代理的非参数 PPO 从经验中学习可重用的程序记忆
ProcMEM: Learning Reusable Procedural Memory from Experience via Non-Parametric PPO for LLM Agents
摘要
LLM 驱动的智能体在顺序决策中表现出强大的性能,但通常依赖于即时推理,甚至在重复出现的场景中重新推导解决方案。这种不充分的经验重用会导致计算冗余和执行不稳定。为了弥补这一差距,我们提出了 ProcMEM,这是一个框架,使代理能够从交互体验中自主学习程序记忆,而无需更新参数。通过形式化 Skill-MDP,ProcMEM 将被动的情景叙述转换为由激活、执行和终止条件定义的可执行技能,以确保可执行性。为了在不降低能力的情况下实现可靠的可重用性,我们引入了非参数 PPO,它利用语义梯度来生成高质量的候选者,并利用 PPO Gate 来进行稳健的技能验证。通过基于分数的维护,ProcMEM 维持紧凑、高质量的程序内存。域内、跨任务和跨代理场景的实验结果表明,ProcMEM 通过极端内存压缩实现了卓越的重用率和显着的性能提升。可视化的进化轨迹和技能分布进一步揭示了 ProcMEM 如何透明地积累、提炼和重用程序知识以促进长期自治。
