论文
World of Workflows:把世界模型引入企业系统的基准
World of Workflows: a Benchmark for Bringing World Models to Enterprise Systems
摘要
前沿大语言模型(LLM)在许多领域作为自主智能体表现出色,但在复杂企业系统中仍未经受检验——在那些系统中,隐藏的工作流会在互联数据库之间产生级联效应。现有企业基准评估的只是类似通用消费基准的表层agentic任务完成,忽视了企业的真正挑战,如有限的可观测性、庞大的数据库状态以及带级联副作用的隐藏工作流。我们提出World of Workflows(WoW),一个基于ServiceNow的真实环境,内嵌4,000多条业务规则与55个活跃工作流,并配套WoW-bench——一个包含234个任务、评估受限agentic任务完成与企业动态建模能力的基准。我们揭示两大要点:(1)前沿LLM存在动态盲视(dynamics blindness),持续无法预测其动作造成的不可见级联副作用,导致隐性约束违反;(2)在不透明系统中的可靠性需要有根据的世界建模,智能体必须在缺乏高保真反馈时通过心理模拟隐藏状态转移来弥合可观测性差距。为获得可靠且有用的企业智能体,WoW促使一个显式学习系统动态的新范式。我们发布用于搭建与评估WoW的GitHub。
