论文
OSWorld 2.0:在长程真实任务上基准测试计算机使用智能体
OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
摘要
既有计算机使用基准未能捕捉真实计算机使用的现实性、复杂性与长程需求。我们引入OSWorld 2.0:108个长程计算机使用工作流的基准——覆盖日常与专业任务。每个任务代表一个现实的端到端工作流:人类用户中位数耗时约1.6小时、Claude Opus 4.7在最大思考下平均需要318次工具调用(OSWorld 1.0约30次)。OSWorld 2.0针对真实工作流中常见但既往基准低估的挑战现象——交互设计挑战(流式交互与动态环境)及智能体模式挑战(跨源推理、隐式状态推断与视觉空间精度)。任务以真实输入工件落地,与有状态用户画像数据交叉引用,含独立的安全报告审计安全敏感执行。500步二元完成度量下:最大思考加批量工具调用的Claude Opus 4.8得分最高但仍仅完成20.6%任务(部分得分54.8%);GPT-5.5 token效率远高但趋平于约13%。结果表明当前智能体仍远非专业级计算机使用:不是在基础GUI控制或编码上绊倒,而是丢失约束追踪、遗漏任务中到达的信息、猜测而非询问用户、跳过验证——在任务取决于必须恢复的隐藏状态时最挣扎。
