论文

MacAgentBench:真实世界macOS桌面上的AI智能体基准

MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

智能体系统Agent HarnessAgent任务评测长程任务评测

摘要

计算机使用代理 (CUA) 在桌面自动化领域取得了快速发展,越来越多的用户在 Mac Mini 上部署 OpenClaw 等 CUA,以实现始终在线的自动化。然而,现有的基准(包括 macOS 的基准)在没有框架增强的情况下评估代理,并且依赖于二进制评估。因此,它们无法捕获现代 CUA 所利用的框架功能以及长期、多应用程序任务的部分进展。我们推出了 MacAgentBench,这是一个全面的 macOS 代理基准测试,包含跨 25 个应用程序的 676 项任务,其中近 60% 涉及 GUI 和 CLI 交互。该基准采用确定性的基于规则的评估,并引入了细粒度的多检查点评分以及针对多应用任务的能力注释。跨三个框架和 16 个模型的实验表明,最佳配置 OpenClaw 上的 Claude Opus 4.6 获得了 73.7% Pass@1,而这一优势主要是由技能库驱动的,而不是由框架设计驱动的。细粒度指标进一步表明,具有相似 Pass@1 的模型在子目标完成方面可能存在很大差异。我们的代码和数据可在 https://github.com/JetAstra/MacAgentBench 上公开获取。

MacAgentBench:真实世界macOS桌面上的AI智能体基准:论文配图
图 1:MacAgentBench 概述。三种代理范例在共享容器化 macOS 环境上运行,操作空间逐渐丰富:纯 GUI 代理、混合框架和代理工具。每个任务都通过基于确定性规则的检查点进行评分,从而在多应用任务上获得部分积分。