论文

EnterpriseOps-Gym:面向企业场景中有状态智能体规划与工具使用的环境与评估

EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

智能体系统AI 基础设施Agent任务评测Sandbox长程任务评测Agent Sandbox

摘要

大语言模型正从被动的信息提供者转变为面向复杂工作流的主动智能体。然而,它们作为可靠AI员工的企业部署因现有基准未能刻画专业环境的复杂性而受阻,具体而言,是未能刻画在持续状态变化与严格访问协议下进行长程规划的需要。在本工作中,我们提出EnterpriseOps-Gym,一个旨在评估真实企业环境中智能体规划的基准。具体来说,EnterpriseOps-Gym提供了一个包含164张数据库表和512个功能工具的容器化沙箱,以模拟真实世界的搜索摩擦。在该环境中,智能体在1,150个由专家整理的任务上接受评估,任务覆盖八个关键业务领域(包括客户服务、人力资源和IT)。我们对14个前沿模型的评估揭示了最先进模型的关键局限:表现最佳的Claude Opus 4.5仅取得37.4%的成功率。进一步分析表明,提供人类专家的oracle计划可将性能提升14-35个百分点,指明策略性推理是主要瓶颈。此外,智能体经常未能拒绝不可行的任务(最佳模型为53.9%),从而导致意外且潜在有害的副作用。我们的发现强调,当前的智能体尚未为自主的企业部署做好准备。更广泛地说,EnterpriseOps-Gym为提升专业工作流中智能体规划的鲁棒性提供了一个具体测试床。

EnterpriseOps-Gym:面向企业场景中有状态智能体规划与工具使用的环境与评估:论文配图
图 2:EnterpriseOps-Gym 概述:状态代理规划和工具使用的基准。 (左上)EnterpriseOps-Gym 跨越八个企业域,并在可重复的沙箱中评估多步骤代理规划、策略遵守、状态驱动的工具调用和跨域编排。 (右上)领域专家创建 sandox 并编写现实的单域和跨域任务,执行真实轨迹,并编写基于结果的验证逻辑,具有多阶段质量保证以及用于完成任务的人工编写的预言机计划。 (下)给定任务和约束(作为系统级策略),代理与环境交互并执行工具。它们由最终状态验证者进行评估,检查目标完成情况、策略合规性和副作用。在上面的示例中,代理未能遵守链接案例知识的系统策略,该策略要求在自动发现知识库时将参数设置为“建议”。此外,由于给定案例的标识符未解析,代理无法正确发送电子邮件通知。