论文

ReSkill:在智能体RL中调和技能创建与策略优化

ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

模型训练上下文与知识智能体系统强化学习记忆Agent SkillsRLVRAgentic RLAgent记忆

摘要

代理强化学习(RL)使LLM代理能够从环境奖励中不断改进,但由此产生的策略并不能系统地积累跨任务泛化的可重用策略。模块化技能可以提供此类可重用的策略,但现有的技能增强强化学习方法将技能创建与策略优化脱钩,从而冒着采用与不断发展的策略相冲突的技能的风险。受 Anthropic 的 Skill Creator 的启发,我们推出了 ReSkill,这是一个 RL-in-the-loop 技能创建框架,可以协调技能进化与策略学习。 ReSkill 利用 GRPO 的分组结构,自然地嵌入三种机制,只需少量额外开销:(1)断言驱动的技能创建器,根据过去的经验诊断故障,并提出有条件的、基于触发的技能修订; (2) 组内推出抽样,能够对技能版本进行受控比较,捕获最能支持政策持续学习的版本; (3) 汤普森抽样,具有自适应折扣,以随着策略的发展平衡技能版本选择中的探索和利用。在多个领域,ReSkill 始终优于现有的基于记忆和技能的强化学习方法,在未见过的任务上取得了最大的进步。对技能生命周期的分析显示,随着策略的改进,技能会自动创建、测试、完善和修剪,从而展示了协调一致的技能与策略共同演化。

ReSkill:在智能体RL中调和技能创建与策略优化:论文配图
图 1:(a) 受到 Anthropic 人机循环技能创建器的启发,ReSkill 将技能创建重新构建为 RL 循环过程。 (b) 与解耦的技能更新方法相比,ReSkill 在策略优化循环内评估不同的技能版本,并使用奖励进行引导更新,从而实现协调的技能策略更新。