论文
ReSkill:在智能体RL中调和技能创建与策略优化
ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL
摘要
代理强化学习(RL)使LLM代理能够从环境奖励中不断改进,但由此产生的策略并不能系统地积累跨任务泛化的可重用策略。模块化技能可以提供此类可重用的策略,但现有的技能增强强化学习方法将技能创建与策略优化脱钩,从而冒着采用与不断发展的策略相冲突的技能的风险。受 Anthropic 的 Skill Creator 的启发,我们推出了 ReSkill,这是一个 RL-in-the-loop 技能创建框架,可以协调技能进化与策略学习。 ReSkill 利用 GRPO 的分组结构,自然地嵌入三种机制,只需少量额外开销:(1)断言驱动的技能创建器,根据过去的经验诊断故障,并提出有条件的、基于触发的技能修订; (2) 组内推出抽样,能够对技能版本进行受控比较,捕获最能支持政策持续学习的版本; (3) 汤普森抽样,具有自适应折扣,以随着策略的发展平衡技能版本选择中的探索和利用。在多个领域,ReSkill 始终优于现有的基于记忆和技能的强化学习方法,在未见过的任务上取得了最大的进步。对技能生命周期的分析显示,随着策略的改进,技能会自动创建、测试、完善和修剪,从而展示了协调一致的技能与策略共同演化。
