论文

ERPBench:以真实业务状态评估企业软件操作智能体

ERPBench: A State-Grounded Evaluation Paradigm for Computer-Use Agents in Enterprise Software

智能体系统Agent任务评测

摘要

通过截图和模拟动作操作的计算机使用智能体快速发展,但评估仍围绕通用桌面和网页任务。ERP系统支撑全球组织的财务、采购、库存和客户运营,对智能体有独特挑战:密集界面、协调多步交互,以及改变持久业务记录而非仅在屏幕显现的错误。现有企业基准依赖专有平台或软件的模拟近似。我们提出ERPBench,在实际运行且可复现的ERP系统上评估仅使用截图的智能体,以数据库真实值为每项任务评分。除基准外,我们提供生产级Harness,将智能体动作置于人工批准之后以安全部署;ERPBench中则自主运行。对六个闭源和开源智能体的评估说明,强通用GUI表现不会自动转化为企业可靠性。即使智能体到达正确表单并保存,存储记录也常错误:部分智能体最多85%的运行能保存,但写入正确值的比例可低至3%。我们进一步刻画企业工作流特有失效模式。

ERPBench:以真实业务状态评估企业软件操作智能体:论文配图
图 2:ERPBench 线束用户界面:显示实时操作员(人类)界面,分为四个功能面板: ① Live ERPNext 应用程序:仅限流式屏幕截图的工作区。 ② 计划工作流程操作日志:显示计划的步骤顺序。 ③ 风险门控审批小组:暂停敏感操作(例如不可逆删除)的执行,等待操作员审核。 ④ 聊天面板:为操作员干预提供直接沟通。