论文
EnterpriseOps-Gym:面向企业场景中有状态智能体规划与工具使用的环境与评估
EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings
摘要
大语言模型正从被动的信息提供者转变为面向复杂工作流的主动智能体。然而,它们作为可靠AI员工的企业部署因现有基准未能刻画专业环境的复杂性而受阻,具体而言,是未能刻画在持续状态变化与严格访问协议下进行长程规划的需要。在本工作中,我们提出EnterpriseOps-Gym,一个旨在评估真实企业环境中智能体规划的基准。具体来说,EnterpriseOps-Gym提供了一个包含164张数据库表和512个功能工具的容器化沙箱,以模拟真实世界的搜索摩擦。在该环境中,智能体在1,150个由专家整理的任务上接受评估,任务覆盖八个关键业务领域(包括客户服务、人力资源和IT)。我们对14个前沿模型的评估揭示了最先进模型的关键局限:表现最佳的Claude Opus 4.5仅取得37.4%的成功率。进一步分析表明,提供人类专家的oracle计划可将性能提升14-35个百分点,指明策略性推理是主要瓶颈。此外,智能体经常未能拒绝不可行的任务(最佳模型为53.9%),从而导致意外且潜在有害的副作用。我们的发现强调,当前的智能体尚未为自主的企业部署做好准备。更广泛地说,EnterpriseOps-Gym为提升专业工作流中智能体规划的鲁棒性提供了一个具体测试床。
