论文

JobBench:让智能体工作与人类意愿对齐

JobBench: Aligning Agent Work With Human Will

智能体系统Agent任务评测

摘要

当前面向职业AI智能体的基准主要以经济价值划定范围,讲述的是一个“替代”故事。我们提出JobBench,它依据专家认定的最值得委托的高优先级工作流来评估AI智能体,基于人类自身需求赋能人类,而非以GDP价值取代人类。JobBench覆盖35个职业的130个智能体任务。每个任务打包为包含异构参考文件的工作区,要求智能体在真实职业工作的杂乱信息流中进行推理。输出由事实锚定的评分细则链来评分,平均每个任务包含35.6项二元判据。我们评估了36个模型;其中最强的、在Claude Code下运行的Claude Opus 4.7也仅达到45.9%。我们希望JobBench能推动社区将目标劳动力市场效应从“替代”转向“增强”:打造智能体去做人类真正想要委托的事,而不只是做经济价值最高的事。

JobBench:让智能体工作与人类意愿对齐:论文配图
图 1:JobBench 概述。任务是在 Workbank [34] 的基础上构建的,这项调查中有超过 1,500 名员工报告了他们更希望人工智能自动化的工作职责。我们选择了 35 个高报告授权偏好和高经济暴露交叉点的职业,然后设计了 130 个符合专家意愿的基准任务。这个例子说明了记者最希望委托给人工智能的一项职责:“检查不同来源的参考资料以获取相关事实”。虚线跟踪每个事实从其源文件,通过它提出的推理挑战,到事实最终支持的可交付成果。