论文

ProcMEM:通过 LLM 代理的非参数 PPO 从经验中学习可重用的程序记忆

ProcMEM: Learning Reusable Procedural Memory from Experience via Non-Parametric PPO for LLM Agents

上下文与知识智能体系统记忆Agent SkillsAgent记忆

摘要

LLM 驱动的智能体在顺序决策中表现出强大的性能,但通常依赖于即时推理,甚至在重复出现的场景中重新推导解决方案。这种不充分的经验重用会导致计算冗余和执行不稳定。为了弥补这一差距,我们提出了 ProcMEM,这是一个框架,使代理能够从交互体验中自主学习程序记忆,而无需更新参数。通过形式化 Skill-MDP,ProcMEM 将被动的情景叙述转换为由激活、执行和终止条件定义的可执行技能,以确保可执行性。为了在不降低能力的情况下实现可靠​​的可重用性,我们引入了非参数 PPO,它利用语义梯度来生成高质量的候选者,并利用 PPO Gate 来进行稳健的技能验证。通过基于分数的维护,ProcMEM 维持紧凑、高质量的程序内存。域内、跨任务和跨代理场景的实验结果表明,ProcMEM 通过极端内存压缩实现了卓越的重用率和显着的性能提升。可视化的进化轨迹和技能分布进一步揭示了 ProcMEM 如何透明地积累、提炼和重用程序知识以促进长期自治。

Skill-Pro:让 LLM 智能体通过非参数 PPO 从经验中学习可复用技能
图2:ProcMEM 框架概览。(左)Skill-MDP:智能体基于状态 s_{t} 和激活条件选择技能 \omega。一个冻结的 LLM 将 \omega 执行为多个步骤的原子动作 a_{t},直至终止。回合结束后的轨迹 𝒯 被存入缓冲区。(中)程序性记忆:通过精炼、生成和基于得分的剪枝对技能进行动态管理,以维持技能池质量。(右)非参数 PPO:进化分两个阶段进行:① 语义梯度:通过后见归因(hindsight attribution)推导并聚合每条轨迹的梯度,生成候选 \omega^{\prime}。② PPO 门控:通过信任域验证筛选候选,仅允许表现最好的有效候选进入技能池。