论文

基准如何给计算机使用智能体打出错误分数

How Benchmarks Mis-Score Computer-Use Agents

模型评测智能体系统Agent任务评测评测方法与指标长程任务评测

摘要

计算机使用智能体(CUA)正被部署用于浏览网页和操作桌面软件,但其基准分数通常仍由脆弱的脚本化判定器产生。分数是一条流水线的输出:任务可能过时,轨迹可能遗漏决定性的视觉证据,评判器可能拒绝有效的替代做法,汇总报告可能掩盖失败原因。我们将这些问题组织成一个覆盖任务构建、轨迹观察、评分与报告的可靠性框架。随后我们审计了来自五个网页、企业工作流与桌面控制基准的 150 条公开的失败判定轨迹,发现 15.3% 的 FAIL 判定是错误的:10.7% 属于评判器假阴性,4.7% 属于任务本身损坏。对于真实失败,三层诊断分类显示验证/反馈与规划失败多于执行/定位错误,这是单一标量成功率无法解释的。我们将这些发现与更新的长程 CUA 基准联系起来,并为 CUA 评测推导出针对各阶段的设计规则。