论文
WorkWorlds:评测AI Agent职场任务的基础设施
WorkWorlds: An Infrastructure for Evaluating AI Agents on Workplace Tasks
摘要
许多知识工作基准围绕单个任务构建,并在任务确定的同时或之后挑选所需上下文。这种设计衡量的是在专为任务搭建的环境中完成类职场任务的能力。当任务描述引导上下文选择时,评测可能将任务信息编码到环境中,预先完成职场任务通常需要的一部分信息定位工作。我们提出 WorkWorlds,一套将组织状态与任务描述分离的评测基础设施:先固定修订版、日期和员工席位,实例化该员工能够访问的组织状态,之后才引入任务。我们主要在一家合成制药公司中实现 WorkWorlds,测量横跨6个员工席位的8个任务,并构建其他组织世界。在192次配对评测中,从为任务筛选的上下文改为角色可见的完整工作环境后,证据访问率由90.4%降至74.5%,评判标准通过率由79.4%降至68.2%,而在已获得证据的条件下,通过率几乎不变;大部分差异发生在 Agent 获得足够证据之前。
