论文

OpenComputer:面向计算机使用智能体的可验证软件世界

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

智能体系统Agent任务评测

摘要

我们提出OpenComputer,一个以验证器为根基的框架,用于为计算机使用智能体构建可验证的软件世界。OpenComputer整合了四个组件:(1)面向具体应用的状态验证器,在真实应用之上暴露结构化检查端点;(2)自演化验证层,利用基于执行的反馈提升验证器可靠性;(3)任务生成流水线,合成真实且机器可校验的桌面任务;(4)评估套件,记录完整轨迹并计算可审计的部分得分奖励。在当前形态下,OpenComputer覆盖33个桌面应用和1000个定稿任务,横跨浏览器、办公工具、创意软件、开发环境、文件管理器与通信应用。实验表明,OpenComputer的硬编码验证器比LLM-as-judge评估更贴近人类裁定,尤其当成功与否取决于细粒度应用状态时。前沿智能体虽有部分进展,却难以完成端到端任务;开源模型相较其OSWorld-Verified得分大幅下滑,暴露出鲁棒计算机自动化方面持续存在的差距。

OpenComputer:面向计算机使用智能体的可验证软件世界:论文配图
图 1:OpenComputer 可验证软件世界综合管道概述。第 1 阶段通过最可靠的检查通道生成特定于应用程序的验证器端点,并通过单元和集成测试对其进行验证,以实现结构化、机器可检查的状态。第 2 阶段关闭了一个自我演化的循环:校准任务驱动强大的代理运行,LLM 评估器和编程验证器产生分歧分析属性的判决,验证器内存 + 检查器/端点/文档修复通过基于执行的反馈完善验证器。第 3 阶段提出用户目标,按复杂性和数据可生成性进行过滤,与验证者进行匹配,综合环境,并发出最终任务实例。第 4 阶段运行代理并计算奖励。