论文
MyPCBench:个人智能计算机使用代理的基准
MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
摘要
当前计算机使用代理的基准评估非个人环境中的模型。这就在评估和部署之间留下了差距,个人助理预计能够在用户的整个数字生活中工作,包括他们的上下文、历史数据和登录帐户。这种差距在网络任务中最为明显,实时网络评估无法运行需要登录或个人信息的网站,而真正的个人助理必须驱动此类网站。我们介绍 MyPCBench,它在 Linux 桌面上测试计算机使用代理作为个人助理的情况,桌面上装有 17 个模拟的真实世界 Web 应用程序和一个完整的桌面堆栈,所有这些都为一个典型角色(来自 The Office 的 Michael Scott)提供种子。我们在此环境中定义了 184 个任务,每个任务都受到来自 OpenClaw 社区的真实请求的启发,并使用统一的计算机 + bash 工具界面对六个封闭和开放权重模型进行了基准测试。我们发现最好的模型 Claude Opus 4.6 完全解决了 55.4% 的任务,是唯一高于 50% 的模型。模型失败集中在跨多个应用程序和长轨迹的任务上,其中个性化对助手的压力最大。我们在 https://mypcbench.com 上发布了环境、任务集和代理工具。