论文

Uno-Orchestra:经选择性委托的简约智能体路由

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

大语言模型(LLM)多智能体系统通常依赖僵硬的编排:要么承诺每查询的平面路由,要么手工工程任务分解——分解深度、工作者选择与推理预算未在单一目标下联合优化。我们提出Uno-Orchestra:一个统一编排策略,选择性地分解任务并把每个子任务派给可允许的(模型,原语)对,两个决策都从扎根真实工作者交互的精选RL轨迹中共同学习。在横跨数学、代码、知识、长上下文与智能体工具使用的13基准套件上对抗22个基线,Uno-Orchestra达到77.0%的宏平均pass@1——比最强工作流基线高约16%,而每查询成本低约一个数量级,推进了选择性委托的准确率-效率前沿。

Uno-Orchestra:经选择性委托的简约智能体路由:论文配图
图1:LLM编排范式:(A)模型路由、(B)分层编排、(C)Uno-Orchestra的选择性委托。