论文

OSWorld 2.0:在长程真实任务上基准测试计算机使用智能体

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks

智能体系统Agent任务评测长程任务评测

摘要

既有计算机使用基准未能捕捉真实计算机使用的现实性、复杂性与长程需求。我们引入OSWorld 2.0:108个长程计算机使用工作流的基准——覆盖日常与专业任务。每个任务代表一个现实的端到端工作流:人类用户中位数耗时约1.6小时、Claude Opus 4.7在最大思考下平均需要318次工具调用(OSWorld 1.0约30次)。OSWorld 2.0针对真实工作流中常见但既往基准低估的挑战现象——交互设计挑战(流式交互与动态环境)及智能体模式挑战(跨源推理、隐式状态推断与视觉空间精度)。任务以真实输入工件落地,与有状态用户画像数据交叉引用,含独立的安全报告审计安全敏感执行。500步二元完成度量下:最大思考加批量工具调用的Claude Opus 4.8得分最高但仍仅完成20.6%任务(部分得分54.8%);GPT-5.5 token效率远高但趋平于约13%。结果表明当前智能体仍远非专业级计算机使用:不是在基础GUI控制或编码上绊倒,而是丢失约束追踪、遗漏任务中到达的信息、猜测而非询问用户、跳过验证——在任务取决于必须恢复的隐藏状态时最挣扎。

OSWorld 2.0:在长程真实任务上基准测试计算机使用智能体:论文配图
图 1:左:典型的 OSWorld 2.0 工作流程:提交 ExpenseFlow 报销索赔。代理必须遵循 PDF 教程、操作遗留报销门户、从嘈杂的收据工件中提取正确的金额、跟踪 GMail 和 ChaseBank 中的订单证据、对更改任务状态的新电子邮件做出反应、从之前的报告中恢复隐藏的员工信息、跨应用程序收集支持文档、识别需要用户澄清的不一致之处,并完成最终审核和提交。右图:不同推理努力水平下的模型性能一览,根据每个任务的输出标记绘制。即使付出更多的推理努力,OSWorld 2.0 上的模型得分仍然远低于 OSWorld 1.0 的性能。