论文

EntWorld:面向可验证企业GUI智能体的整体环境与基准

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

智能体系统Agent任务评测

摘要

多模态大语言模型(MLLM)的最新进展使智能体能够在开放式的网页和操作系统中运行。然而,现有基准主要面向消费级场景(如电商和旅行预订),未能捕捉专业企业工作流的复杂性与严格性。企业系统带来独特挑战,包括高密度用户界面、严格的业务逻辑约束,以及对精确、状态一致的信息检索的强依赖——当前通用智能体在这些方面往往表现不佳。为填补这一空白,我们提出EntWorld,一个由跨六个代表性企业领域的1,756个任务构成的大规模基准,涵盖客户关系管理(CRM)、信息技术基础设施库(ITIL)和企业资源计划(ERP)系统等。与依赖脆弱执行轨迹或大量人工标注的以往数据集不同,EntWorld采用基于schema的任务生成框架,直接从底层数据库模式反向工程业务逻辑,从而能够合成真实的长期工作流。此外,我们提出基于SQL的确定性验证机制来构建数据集,用严格的状态转换验证取代模糊的视觉匹配。实验结果表明,最先进的模型(如GPT-4.1)在EntWorld上仅取得47.61%的成功率,远低于人类水平,凸显了当前Agentic能力中显著的企业差距以及开发领域专用智能体的必要性。我们发布EntWorld作为严格测试床,以促进下一代企业级数字智能体的开发与评估。

EntWorld:面向可验证企业GUI智能体的整体环境与基准
图5:一例因 UI 元素类型误判而导致的智能体失败案例,其中智能体错误地理解界面组件并执行与实际环境状态不一致的动作,最终偏离预期工作流。该案例关于 iTOP。