论文
cua-speedrun:计算机使用Agent速度的标准化基准测试
cua-speedrun: Standardized Benchmarking of the Speed of Computer-Use Agents
摘要
计算机使用Agent (CUA) 使用图形用户界面 (GUI) 在计算机上完成任务,最近在许多标准基准测试中超越了人类表现,包括困难的长期任务。它们的能力无疑令人印象深刻,但是,广泛采用和部署 CUA 的一个关键障碍仍然是它们的速度和成本。迈向更快、更强大的 CUA 需要对其速度进行可靠的评估,但许多 CUA 基准目前面临可重复性危机。基准测试基于具有不同机器和容器配置的复杂基础设施,这些配置混淆了 CUA 执行速度的评估。为了解决这一差距,我们提出了 cua-speedrun,它引入了标准化基础设施和任务集,重点是评估 CUA 的速度和效率。 cua-speedrun 使用统一的虚拟机设置和执行管道,以及通用Agent接口,使单Agent实现能够跨不同基准无缝运行。通过四个不同的 CUA 基准,我们评估推理工作、Agent利用和环境延迟如何影响性能、速度和成本。我们发现没有一个模型系列对于所有这三个模型都是最佳的;没有一个开放权重模型处于前沿,而且,不直观的是,对于某些模型来说,增加推理工作可以加快任务完成速度,而更快的环境输入输出可能会减慢整体任务完成时间。我们还证明,我们可以有效地减少大多数 CUA 基准测试的评估任务集,而不会降低整体统计能力,从而实现更有效的基准测试和比较。我们相信 cua-speedrun 将推动实现快速、高效的 CUA 的结构化进展,解锁新的现实用例和应用程序。所有代码、基础设施和分析均可在 https://cuaspeedrun.com. 获取