论文

SkillComposer:学习发展代理技能以进行规范化和泛化

SkillComposer: Learning to Evolve Agent Skills for Specification and Generalization

智能体系统Agent Harness

摘要

代理技能由指导代理推理和行动的可重用策略组成,已显示出在推理时提高模型能力的强大潜力。然而,当前的技能构建方法将问题视为一次性提取,忽视了一个根本的张力:针对特定任务定制的技能无法迁移,而抽象的技能往往提供不足的指导。我们将这种脆弱性归因于缺乏明确的技能规范和泛化机制。为了解决这一差距,我们引入了 SkillComposer,这是一个将技能构建分解为三个可学习操作的框架:创建、改进和合并。 SkillComposer 通过系统拒绝采样方法进行训练,使语言模型能够在推理时自我进化技能,并支持三种部署模式:离线构建通用库、在线用于特定任务的细化以及混合两者的结合。 $τ^2$-Bench、LiveCodeBench v6 和 AppWorld 上的综合实验表明,SkillComposer 始终优于基线。我们的 SkillComposer-4B 将 27B 执行器在代理任务上提高了 4.5 倍,在代码任务上提高了 3.4 倍,同时泛化了训练期间未见的领域和任务类型。分析表明,合并和改进解决了正交质量维度,并且技能构成是一种可转移的元能力,为技能增强推理提供了实用的方法。