论文
Skill1:经强化学习实现技能增强智能体的统一进化
Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning
摘要
持久技能库允许语言模型智能体跨任务复用成功策略。维护这样的库需要三种耦合能力:智能体选择相关技能、在执行中使用它、并从经验蒸馏新技能。既有方法孤立优化这些能力或使用分离的奖励源,导致部分且冲突的进化。我们提出Skill1:训练单一策略协同进化技能选择、使用与蒸馏,对齐共享的任务结果目标。策略生成查询以搜索技能库、重排候选以选择其一、以其为条件解题、并从轨迹蒸馏新技能。全部学习源自单一任务结果信号:其低频趋势为选择记账、高频波动为蒸馏记账。ALFWorld与WebShop上的实验显示Skill1超越既往基于技能与强化学习的基线。训练动态确认三种能力的协同进化,消融显示移除任一记账信号都会退化进化。
