论文

R$^2$ 流程:通过递归技能进化实现递归自我提升

R$^2$ Flow: Recursive Self-Improvement via Recursive Skill Evolution

模型训练智能体系统强化学习Agent HarnessAgent Skills智能体自我改进Agentic RL递归自我改进(RSI)

摘要

基于LLM的Agent可以通过重用和修改他们编排成可执行程序的技能来提高自己的跨任务能力。基于流程的训练适合这个循环:它按照奖励的比例对程序进行采样,并且每项技能的流程将其归功于下一次库修订。三个障碍阻碍了这种自我改进的可靠性:流程训练在树形结构历史上遭遇策略崩溃;基于非负流量的信用奖励频繁使用,就好像它是好处一样;库编辑取决于策略优化的任务奖励。我们引入了 R$^2$ Flow,这是一个递归自我改进框架,可以在共享状态编排图上交替进行策略学习、独立验证和版本化技能库更新。该图合并了仅独立步骤顺序不同的历史记录,允许流程训练在等效执行中汇集证据。经过训练的流的流共享读数,对后向策略不变,以及要更改哪些技能的单独签名实用程序等级,验证者证据决定是否需要编辑,并且剩余方差高原设置何时更新。承诺的编辑重塑了下一个策略学习的图表,实现了递归技能进化。在问答、数学推理、交互式决策和代码生成方面,R$^2$ Flow 比启发式编排、强化学习和技能进化基线以及执行器之间的传输提高了任务准确性和库编辑精度。代码可在 https://github.com/beita6969/r2flow. 获取