论文

EvoCUA:经可扩展合成经验学习的进化式计算机使用智能体

EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience

模型训练AI 基础设施强化学习SandboxAgentic RLAgent Sandbox

摘要

原生计算机使用智能体(CUA)的开发代表多模态 AI 的重大飞跃。然而,其潜力目前受制于静态数据扩展的约束。主要依赖对静态数据集被动模仿的现有范式,难以捕捉长程计算机任务固有的复杂因果动力学。在本工作中,我们提出 EvoCUA,一个原生计算机使用智能体模型。与静态模仿不同,EvoCUA 把数据生成与策略优化整合为自我维系的进化循环。为缓解数据稀缺,我们开发可验证合成引擎,自主生成多样任务并配以可执行验证器。为支持大规模经验获取,我们设计可扩展基础设施,编排数以万计的异步沙盒 rollout。在这些海量轨迹之上,我们提出迭代进化学习策略以高效内化经验。该机制通过识别能力边界动态调节策略更新——强化成功例程,同时通过错误分析与自我纠正把失败轨迹转化为丰富监督。在 OSWorld 基准上的实证评估显示,EvoCUA 达到 56.7% 的成功率,确立新的开源最先进水平。值得注意的是,EvoCUA 显著超过此前最佳开源模型 OpenCUA-72B(45.0%),并超过 UI-TARS-2(53.1%)等领先闭源权重模型。关键的是,我们的结果强调该方法的泛化性:从经验中学习驱动的进化范式在不同规模的基础模型上带来一致性能增益,为推进原生智能体能力确立了一条鲁棒且可扩展的路径。

EvoCUA:经可扩展合成经验学习的进化式计算机使用智能体
图2:EvoCUA 概览。该图展示了从静态模仿到主动演化的经验学习循环(中间)的范式转变。该方法统一了三个核心模块:Verifiable Synthesis Engine(左上);Scalable Interaction Infrastructure(右侧);以及 Iterative Optimization(左下)。