论文

超越一体式代理:对企业工作流程中角色专用的多代理协作进行基准测试

Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 代理越来越多地被期望在企业环境中运行,在企业环境中,工作分布在专门的角色、权限控制的系统和跨部门的程序之间。然而,现有的企业基准主要评估具有广泛工具访问权限的单个代理,而现有的多代理基准很少捕获现实的企业约束,例如角色专业化、访问控制、有状态业务系统和基于策略的批准。我们引入 \textsc{EntCollabBench},一个评估企业多代理协作的基准。 \textsc{EntCollabBench} 模拟一个权限隔离的组织,拥有跨 6 个部门的 11 个角色专门代理,并包含两个评估子集:一个工作流子集,其中代理协作修改企业系统状态;以及一个审批子集,其中代理做出基于策略的决策。评估基于执行跟踪、数据库状态验证和确定性策略裁决,而不是自然语言响应判断。对代表性 LLM 代理的实验表明,当前模型仍然难以应对端到端企业协作,特别是在委派、上下文传输、参数基础、工作流关闭和决策承诺方面。 \textsc{EntCollabBench} 提供了一个可重复的测试平台,用于测量和改进适用于现实组织环境的代理系统。