论文
JobBench:让智能体工作与人类意愿对齐
JobBench: Aligning Agent Work With Human Will
摘要
当前面向职业AI智能体的基准主要以经济价值划定范围,讲述的是一个“替代”故事。我们提出JobBench,它依据专家认定的最值得委托的高优先级工作流来评估AI智能体,基于人类自身需求赋能人类,而非以GDP价值取代人类。JobBench覆盖35个职业的130个智能体任务。每个任务打包为包含异构参考文件的工作区,要求智能体在真实职业工作的杂乱信息流中进行推理。输出由事实锚定的评分细则链来评分,平均每个任务包含35.6项二元判据。我们评估了36个模型;其中最强的、在Claude Code下运行的Claude Opus 4.7也仅达到45.9%。我们希望JobBench能推动社区将目标劳动力市场效应从“替代”转向“增强”:打造智能体去做人类真正想要委托的事,而不只是做经济价值最高的事。
