论文

World of Workflows:把世界模型引入企业系统的基准

World of Workflows: a Benchmark for Bringing World Models to Enterprise Systems

智能体系统Agent任务评测

摘要

前沿大语言模型(LLM)在许多领域作为自主智能体表现出色,但在复杂企业系统中仍未经受检验——在那些系统中,隐藏的工作流会在互联数据库之间产生级联效应。现有企业基准评估的只是类似通用消费基准的表层agentic任务完成,忽视了企业的真正挑战,如有限的可观测性、庞大的数据库状态以及带级联副作用的隐藏工作流。我们提出World of Workflows(WoW),一个基于ServiceNow的真实环境,内嵌4,000多条业务规则与55个活跃工作流,并配套WoW-bench——一个包含234个任务、评估受限agentic任务完成与企业动态建模能力的基准。我们揭示两大要点:(1)前沿LLM存在动态盲视(dynamics blindness),持续无法预测其动作造成的不可见级联副作用,导致隐性约束违反;(2)在不透明系统中的可靠性需要有根据的世界建模,智能体必须在缺乏高保真反馈时通过心理模拟隐藏状态转移来弥合可观测性差距。为获得可靠且有用的企业智能体,WoW促使一个显式学习系统动态的新范式。我们发布用于搭建与评估WoW的GitHub。

World of Workflows:把世界模型引入企业系统的基准
图2:WoW 与以往企业级基准的对比。WoW 包含复杂的工作流与业务规则,引入可能影响数据库状态的隐藏数据流与 API 调用。与不涉及工作流的以往环境相比,WoW 要求智能体对系统动态建模,以正确执行任务并遵循约束。我们引入一种对观测空间的增强,将表审计(table audits)作为易于处理的状态变化,为智能体提供底层信息。