论文

规划器即路由器:联合规划时间模型路由,实现经济高效的多Agent工作流

Planner-as-Router: Joint Plan-Time Model Routing for Cost-Efficient Multi-Agent Workflows

智能体系统Agent 规划Agent Harness

摘要

在生产环境中运行大语言模型 (LLM) Agent会很快变得昂贵。前沿模型(最大、最有能力的层)是准确的,但每个词元的成本可能是小型模型成本的 25 倍,而且一旦工作流程将多个调用链接在一起,差距就会加剧。规划器即路由器(PaR)从不同的角度解决这个问题。它不是将模型层选择留给下游的某些组件,而是将选择折叠到规划本身中。当规划器将查询分解为子任务时,它还会为每个子任务分配一个模型大小层(小型、中型或前沿,按功能和价格排序),因此子任务之间的依赖关系在任何专家运行之前都是可见的。与每次调用的路由器(例如级联路由)不同,PaR 会预先查看整个工作流程,并且不需要单独的路由器模型或训练数据。我们使用 EntBench 评估 PaR,EntBench 是跨七个类别的 54 个企业 agentic 任务的基准,通过针对实时数据库实际运行生成的结构化查询语言 (SQL) 和 MongoDB 查询来进行评分。经过针对八个路由器和三个种子的 1,157 次评估,PaR 保持在观察到的成本准确性前沿。它在可比较成本下的准确度上与接收器前沿启发式(仅终端节点上的前沿模型)相匹配,并在较低成本下与忠实的 FrugalGPT 级联相匹配,并且与全前沿路由相比,它的成本降低了 44%,同时精度降低了 2.9 个点。在 54 项任务的研究中,有几个准确度差距落在正负六点置信区间内,因此我们将 PaR 的优势视为前沿位置,而不是干净利落的准确度胜利。我们还报告了初步观察结果,而不是经过验证的结果:一个小型试点暗示廉价路由可能会对组合工作流程带来隐藏的复合惩罚,我们将其作为未来测量的假设。 PaR、EntBench 和所有评估代码都是开源的。