论文

SkillCycle:让Agent策略与技能库共同演进

SkillCycle: Co-Evolving Agent Policies and Skill Banks

智能体系统模型优化Agent Skills智能体自我改进蒸馏

摘要

内化外部技能会改变语言Agent的能力,并随之改变其剩余指导的价值:对于新遇到的决策,规则可能变得多余、误导或不足。这就产生了学习技能和调整监督进一步学习的技能的耦合问题。我们引入了 SkillCycle,这是一个通过技能内化和规则修订之间的反馈循环共同发展Agent政策和技能库的框架。我们的核心贡献是赋予蒸馏反馈第二个作用:Token级别的上下文差异有助于找到检查规则,而交互结果则指导对其内容和适用性的编辑。 SkillCycle 在两个阶段之间交替:使用固定技能库和路由器进行策略学习,以及使用冻结策略进行规则修订。候选编辑在指导下一个学习周期之前会进行规则级别和整个银行环境的比较。在 WebShop 上,具有 3B 模型的 SkillCycle 在没有推理时间技能输入的情况下取得了 74.74% 的成功率和 88.37 分,代表 与最先进的 (SOTA) 模型相比,分别相对提高了 0.73% 和 3.96%。在 ALFWorld 和 WebShop 上的第 3 轮消融中,SkillCycle 的无技能成功率相对于静态技能库分别提高了 10.18% 和 18.11%,相对于单个技能库更新分别提高了 2.41% 和 2.50%。这些结果表明,随着Agent能力的变化不断修改技能指导有助于将外部技能转化为推理时不需要技能输入的策略能力。我们将发布代码、配置、技能库和评估协议。

SkillCycle:让Agent策略与技能库共同演进:论文原图
图 2:SkillCycle 架构。 (a) 状态感知路由选择来自银行的技能指导。 (b) 在银行和路由器冻结的情况下,共享权重、技能条件的教师对无技能学生的回答重新评分;签署OPD信号和环境反馈指导政策学习。 (c) OPD 诊断和轨迹结果通知离线保留、重写、删除和添加提案。 (d) 冻结政策下的配对推出验证候选版本的修订;接受的更新指导下一个学习周期。网上商店还使用经过验证的选择性教师演示。这里,hth_{t} 表示任务指令和可观察的交互历史。条形图和轨迹是示意性的。