论文
SkillCycle:让Agent策略与技能库共同演进
SkillCycle: Co-Evolving Agent Policies and Skill Banks
摘要
内化外部技能会改变语言Agent的能力,并随之改变其剩余指导的价值:对于新遇到的决策,规则可能变得多余、误导或不足。这就产生了学习技能和调整监督进一步学习的技能的耦合问题。我们引入了 SkillCycle,这是一个通过技能内化和规则修订之间的反馈循环共同发展Agent政策和技能库的框架。我们的核心贡献是赋予蒸馏反馈第二个作用:Token级别的上下文差异有助于找到检查规则,而交互结果则指导对其内容和适用性的编辑。 SkillCycle 在两个阶段之间交替:使用固定技能库和路由器进行策略学习,以及使用冻结策略进行规则修订。候选编辑在指导下一个学习周期之前会进行规则级别和整个银行环境的比较。在 WebShop 上,具有 3B 模型的 SkillCycle 在没有推理时间技能输入的情况下取得了 74.74% 的成功率和 88.37 分,代表 与最先进的 (SOTA) 模型相比,分别相对提高了 0.73% 和 3.96%。在 ALFWorld 和 WebShop 上的第 3 轮消融中,SkillCycle 的无技能成功率相对于静态技能库分别提高了 10.18% 和 18.11%,相对于单个技能库更新分别提高了 2.41% 和 2.50%。这些结果表明,随着Agent能力的变化不断修改技能指导有助于将外部技能转化为推理时不需要技能输入的策略能力。我们将发布代码、配置、技能库和评估协议。
