论文

WeaveBench:面向混合接口计算机使用智能体的长程真实世界基准

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

智能体系统Agent任务评测长程任务评测

摘要

计算机使用代理 (CUA) 越来越多地在结合了可视化桌面控制、命令行执行、代码编辑、浏览器和外部工具的运行时中运行。然而,现有的基准测试通常将这些接口评估为可分离的功能,从而导致长期跨接口编排尚未得到测试。因此,我们推出了 WeaveBench,这是一个长期混合接口基准测试,包含跨 8 个实际工作领域的 114 项任务,以真实用户请求和可公开验证的工件为基础。每项任务都要求代理在单个轨迹内将 GUI 观察/操作与 CLI/代码操作结合起来。我们在部署的 CLI 代理运行时内的真实 Ubuntu 桌面上评估这些任务,并使用最小的桌面控制插件进行了增强。我们还提出了一个同伴轨迹感知法官,用于检查可交付成果、文件、屏幕截图、日志和操作痕迹,同时检测伪造的视觉证据或硬编码指标等捷径行为。在前沿模型-运行时配对中,最佳通过率仅达到 41.2%,表明基准测试仍远未饱和。轨迹感知法官进一步揭示,仅结果评分大大高估了代理人的表现。总体而言,WeaveBench 暴露了 CUA 评估中的一个关键差距,并提供了一个有效的测试平台来衡量代理是否可以跨长期现实世界任务编排 GUI、CLI 和代码操作。

WeaveBench:面向混合接口计算机使用智能体的长程真实世界基准:论文配图
图 1:需要交错混合接口的三个实际工作流程。 (DAV) 通过检查 Jaeger 跟踪跨度的形状来诊断 Jaeger 跟踪跨度,然后通过 kubectl 修补上游超时; (游戏)玩桌面游戏来定位精灵/物理错误,然后修补场景图源; (OPS) 在 Web Ops 仪表板上捕获 503 峰值,编辑 nginx.conf,并重新检查仪表板。每个步骤都会在没有 API 公开的 GUI 信号和没有屏幕截图可以生成的 CLI/代码更改之间交替。