论文

SkillForge:让技能库与Agent策略共同演化

SkillForge: Co-Evolving Skills and Agents via Dynamic Skill Lifecycles

模型训练智能体系统强化学习Agent Skills智能体自我改进Agentic RL

摘要

记忆增强强化学习增强了 LLM Agent解决复杂的长期任务的能力。技能就是这样一种形式的记忆,将指令与任务类型的适用性条件配对。然而,随着策略的改进,不加区别地保留每项技能会让过时或有害的条目积累并误导Agent。我们提出了 SkillForge,一种 Agentic RL 方法,通过适应度驱动的试用、活跃、稳定和退休状态的技能生命周期来编译和进化技能库,以便技能和模型在整个训练过程中共同进化。强化学习前评估阶段首先使用基础模型自身的Rollout来预先淘汰低适应度技能,产生一个过滤库,然后进行监督微调。强化学习接管这个检查点,并且在每次迭代中选择性退休、稳定和 LLM 引导的突变继续在策略优化的同时打造技能库。在多个交互式Agent基准测试中,SkillForge 实现了最高的总体成功率,与最强基线相比相对提高了高达 7.8%,同时在整个训练过程中保持技能库紧凑。我们引入了 SkillFurnace,这是一个包含超过 5000 条注释记录的数据集,其中捆绑了经过退休筛选的 SFT 轨迹、带有适应度注释的进化技能库以及带有人工注释故障类别的退休事件,以支持技能质量和生命周期管理的研究。

SkillForge:让技能库与Agent策略共同演化:论文原图
图 1:SkillForge 概述。上图:种子技能在基础模型自己的推出中预先退役;幸存的经过健康验证的技能会催生退休意识冷启动和技能政策共同进化的强化学习,从而产生一个经过培训的代理,并具有适应的技能库。左下:用幸存技能对成功轨迹进行冷启动微调。右下:技能和模型在健身驱动的生命周期中共同进化,通过选择性退休、稳定、降级和LLM引导的突变,在试验、活跃、稳定和退休之间进行。