论文

Skill1:经强化学习实现技能增强智能体的统一进化

Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

模型训练智能体系统强化学习Agent SkillsAgentic RL

摘要

持久技能库允许语言模型智能体跨任务复用成功策略。维护这样的库需要三种耦合能力:智能体选择相关技能、在执行中使用它、并从经验蒸馏新技能。既有方法孤立优化这些能力或使用分离的奖励源,导致部分且冲突的进化。我们提出Skill1:训练单一策略协同进化技能选择、使用与蒸馏,对齐共享的任务结果目标。策略生成查询以搜索技能库、重排候选以选择其一、以其为条件解题、并从轨迹蒸馏新技能。全部学习源自单一任务结果信号:其低频趋势为选择记账、高频波动为蒸馏记账。ALFWorld与WebShop上的实验显示Skill1超越既往基于技能与强化学习的基线。训练动态确认三种能力的协同进化,消融显示移除任一记账信号都会退化进化。

Skill1:经强化学习实现技能增强智能体的统一进化:论文配图
图 1:技能增强代理的训练范例。 (a) 技能增强代理循环由选择、利用和蒸馏组成。 (b) 先前的方法将一些阶段委托给没有策略梯度的外部模块(例如,冻结选择或使用外部教师进行蒸馏)。 Skill1 使用共享的任务结果信号在所有三个阶段训练单一策略。