论文

专业化角色,混合部署:推动 LLM 代理团队的成本准确性前沿

Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

模型评测基准与评测资源

摘要

LLM 代理越来越多地部署为多角色团队,其中任务分为规划者、执行者和验证者等专业角色。在这些系统中,成本和准确性不再是单个模型的属性:它们取决于哪个模型填补每个角色以及它的托管位置,包括 API、自托管和混合部署。现有的代理基准通常评估固定模型或固定代理配置,因此为成本准确性最优部署提供有限的指导。我们推出 AgentCARD,这是一个角色感知基准套件,用于跨角色分配和部署模式评估 LLM 代理团队。 AgentCARD 结合了角色分解的评估工具、统一的 API/自托管成本模型、Pareto 前沿分析以及用于识别角色瓶颈的基于 Shapley 的诊断。我们的评估表明,异构团队始终占据成本准确性前沿。与同等成本的同质团队相比,它们的准确性提高了高达 44\%$,或者通过混合部署,每项任务成本降低了 12\x$,可与最强大的同质团队相媲美。我们进一步发现,最佳的角色分配是与领域相关的:一些领域是计划者瓶颈,而另一些领域是执行者瓶颈。最后,AgentCARD 超越了规划者-执行者团队,扩展到具有验证等附加角色的工作流程,并支持随着新领域和团队结构的出现而进行持续评估。我们的代码发布于:https://github.com/Auto-CAP/AgentCAP