论文

Evolving-RL:智能体中经验驱动自我进化能力的端到端优化

Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

模型训练强化学习RLVRAgentic RL

摘要

经验驱动的自我进化智能体旨在通过从过往交互中蒸馏可复用经验来克服大语言模型的静态性,从而在部署时适应新任务。这一过程对基座模型的抽象、泛化与上下文学习能力提出了很高要求。然而,现有研究大多聚焦于系统级设计选择(例如经验如何表示与管理),忽视了底层模型固有的能力。尽管近期一些工作开始通过强化学习优化经验利用阶段,但仍未把自我进化当作一个需要联合优化的统一过程。为此,我们提出Evolving-RL,一个高效的算法框架,联合提升自我进化所需的经验提取与利用能力。具体而言,我们将学习过程以经验提取与评估为中心,利用源自评估的两路监督信号分别优化提取器与求解器,从而实现二者的协同共同进化。在ALFWorld与Mind2Web上的实验表明,Evolving-RL有效增强了LLM提取与复用经验的能力,在分布外任务上带来强劲的性能提升(在ALFWorld未见任务上相对GRPO基线最高提升98.7%,在Mind2Web上提升35.8%),且这些增益只有通过经验提取与利用的协同共同进化才能完全释放。此外,Evolving-RL本身就起到经验增强RL算法的作用。通过将可复用经验模式直接内化到模型参数中,即使在没有测试时经验积累的情况下,它也在已见与未见任务上均取得远超标准基线的性能提升。

Evolving-RL:智能体中经验驱动自我进化能力的端到端优化:论文配图
图 2:Evolving-RL 概述。该框架从在线技能提取开始,然后对提取的技能进行下游评估。该评估过程为提取器和求解器生成训练信号,使它们能够在统一的协同进化框架内进行联合优化。