论文

SkillOrchestra:通过技能迁移学习智能体路由

SkillOrchestra: Learning to Route Agents via Skill Transfer

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

复合 AI 系统有望超越单个模型的能力,但其成功在很大程度上取决于有效的编排。现有路由方法存在两个局限:(1) 输入级路由器做出粗粒度的查询级决策,忽略不断演化的任务需求;(2) 经 RL 训练的编排器适配成本高,且常出现路由坍缩,即在多轮场景中反复调用同一个强但昂贵的选项。我们提出 SkillOrchestra,一个技能感知的编排框架。SkillOrchestra 不直接端到端学习路由策略,而是从执行经验中学习细粒度技能,并在这些技能下建模各智能体的能力与成本。部署时,编排器推断当前交互的技能需求,并在显式的性能-成本权衡下选择最能满足需求的智能体。跨十个基准的大量实验表明,SkillOrchestra 优于 SoTA 的基于 RL 的编排器最多 22.5%,且相比 Router-R1 和 ToolOrchestra 分别降低 700 倍和 300 倍学习成本。这些结果表明,显式技能建模可以实现可扩展、可解释且样本高效的编排,为数据密集的 RL 方法提供了有原则的替代方案。代码见 https://github.com/jiayuww/SkillOrchestra。

SkillOrchestra:通过技能迁移学习智能体路由
图2:模型路由与智能体编排方法的比较。(左)模型路由执行静态的、查询级的模型选择,不具备动态模式或工具推理。(中)直接智能体编排以隐式能力建模进行端到端的路由学习,容易出现路由坍塌。(右)技能感知的智能体编排利用可复用的 Skill Handbook 进行显式的技能级能力建模,实现均衡的智能体利用与可扩展性。