论文

WorkWorlds:评测AI Agent职场任务的基础设施

WorkWorlds: An Infrastructure for Evaluating AI Agents on Workplace Tasks

智能体系统Agent任务评测

摘要

许多知识工作基准围绕单个任务构建,并在任务确定的同时或之后挑选所需上下文。这种设计衡量的是在专为任务搭建的环境中完成类职场任务的能力。当任务描述引导上下文选择时,评测可能将任务信息编码到环境中,预先完成职场任务通常需要的一部分信息定位工作。我们提出 WorkWorlds,一套将组织状态与任务描述分离的评测基础设施:先固定修订版、日期和员工席位,实例化该员工能够访问的组织状态,之后才引入任务。我们主要在一家合成制药公司中实现 WorkWorlds,测量横跨6个员工席位的8个任务,并构建其他组织世界。在192次配对评测中,从为任务筛选的上下文改为角色可见的完整工作环境后,证据访问率由90.4%降至74.5%,评判标准通过率由79.4%降至68.2%,而在已获得证据的条件下,通过率几乎不变;大部分差异发生在 Agent 获得足够证据之前。

WorkWorlds:评测AI Agent职场任务的基础设施:论文配图
图 1:WorkWorlds 概览。一次修订、一个日期和一个员工席位从持久的组织世界中实例化出角色可见的投影。只有在该投影固定之后才施加任务,随后将候选者可见的信息与验证方评分信息分离,并对智能体进行执行与评分。