论文

WorkBench重新审视:两年后的职场智能体

WorkBench Revisited: Workplace Agents Two Years On

智能体系统Agent任务评测

摘要

2024 年 3 月 WorkBench 上最好的代理 GPT-4 仅完成了 43% 的任务。我们在 2026 年 6 月重新审视基准,发现迄今为止最好的智能体 Claude Fable 5 现在完成了 98%。除了边境智能体绩效的显着进步之外,还有三件事值得注意。首先,意外的有害行为,例如向错误的人发送电子邮件,从 GPT-4 的 26% 下降到 Claude Fable 5 的 1.9%;功能和安全性在 WorkBench 上是相辅相成的,而不是权衡取舍,因此完成最多任务的模型也会造成最少的意外损坏。其次,开放重量模型的兴起大大降低了只有专有模型才能达到的性能水平的成本,而前沿成本保持稳定。第三,虽然已经消除了几类错误,但前沿模型仍然会犯一些基本错误,这些错误有时会导致不可逆转的损害。我们发布了基准测试的更新版本,其中包括数据和代码质量改进、新模型得分以及自 2024 年以来 WorkBench 上的代理进度分析。