论文
OpenComputer:面向计算机使用智能体的可验证软件世界
OpenComputer: Verifiable Software Worlds for Computer-Use Agents
摘要
我们提出OpenComputer,一个以验证器为根基的框架,用于为计算机使用智能体构建可验证的软件世界。OpenComputer整合了四个组件:(1)面向具体应用的状态验证器,在真实应用之上暴露结构化检查端点;(2)自演化验证层,利用基于执行的反馈提升验证器可靠性;(3)任务生成流水线,合成真实且机器可校验的桌面任务;(4)评估套件,记录完整轨迹并计算可审计的部分得分奖励。在当前形态下,OpenComputer覆盖33个桌面应用和1000个定稿任务,横跨浏览器、办公工具、创意软件、开发环境、文件管理器与通信应用。实验表明,OpenComputer的硬编码验证器比LLM-as-judge评估更贴近人类裁定,尤其当成功与否取决于细粒度应用状态时。前沿智能体虽有部分进展,却难以完成端到端任务;开源模型相较其OSWorld-Verified得分大幅下滑,暴露出鲁棒计算机自动化方面持续存在的差距。
