论文
OSWorld-Pro:基于过程的计算机使用代理评估
OSWorld-Pro: Process-based Evaluation for Computer Use Agents
摘要
计算机使用代理 (CUA) 的评估通常仅限于它们创建的最终可交付成果(在数百个步骤结束时)并由功能验证者进行评估,如 OSWorld 中所示。然而,这种对最终状态绩效的评估缺乏对智能体如何以及为何在各种任务中失败的透明度,从而混淆了后续改进的关键见解。例如,在键盘输入期间出错的代理需要与那些无法在图形 UI 上精确提供基于点击的输入的代理不同的缓解策略。我们推出了 OSWorld-Pro:一组包含超过 2800 个子目标的 300 多个任务,可对基于 67,000 多个人工注释的 CUA 进行程序评估。我们使用强大的、人性化的大语言模型法官来评估 OSWorld-Pro 子目标的实现情况,从而揭示模型在一系列顺序依赖的子目标中取得的进展。我们的研究结果表明,即使对于最先进的大语言模型来说,OSWorld-Pro 也具有挑战性,像 Claude Opus 5 这样表现最好的人只取得了 75.7% 的成绩,而 OSWorld 上的成绩为 83.4%。此外,我们还确定了各种模型的以关键流程为中心的故障模式(例如与子目标无关的操作和基于点击的错误),为提高 CUA 的性能和效率提供见解。