论文

SEARL:面向自进化智能体的策略与工具图记忆联合优化

SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents

上下文与知识模型训练强化学习记忆RLVRAgentic RLAgent记忆

摘要

可验证奖励强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)的最新进展已在单轮推理任务中展现出显著潜力。随着范式向自进化智能体学习转变,模型被越来越期望通过合成工具或积累显式经验从轨迹中学习。然而,主流方法通常依赖大规模LLM或多智能体框架,这阻碍了它们在资源受限环境中的部署。基于结果的奖励固有的稀疏性也构成了重大挑战,因为智能体通常只有在任务完成后才能获得反馈。为解决这些局限,我们提出了基于工具记忆的自进化智能体框架SEARL。与直接利用交互经验的方法不同,我们的方法构建了将规划与执行相整合的结构化经验记忆。这提供了一种新颖的状态抽象,有助于在类似情境间泛化,例如工具复用。因此,智能体在从历史数据中提取显式知识的同时,利用轨迹间关联来稠密化奖励信号。我们在知识推理与数学任务上评估了该框架,证明了其在实现更实用、更高效学习方面的有效性。

SEARL:面向自进化智能体的策略与工具图记忆联合优化:论文配图
图1:现有范式局限:整体式工具合成令LLM不堪重负,需分而治之;现有记忆设计则缺乏结构连通性,引出SEARL的联合优化动机。