模型

美团 EvoCUA 开源:OSWorld 56.7% ,32B 逼近 Claude-4.5-Sonnet

美团EvoCUA刷新开源SOTA,会用电脑还会持续进化的智能体

智能体系统模型评测应用与实践Agent 动作执行与治理Agent 环境交互模型能力评测视觉感知与空间理解

概述

EvoCUA 为原生计算机操作智能体(CUA)模型,把训练范式从静态轨迹模仿转为经验进化学习。主力模型 EvoCUA-32B 基于 Qwen3-VL-32B-Thinking 后训练,在在线评测基准 OSWorld 上取得 56.7% 成功率(2026 年 1 月 6 日榜单),刷新开源 SOTA,大幅领先此前开源 SOTA OpenCUA-72B(45.0%),并超过闭源强基线 UI-TARS-2-2509(53.1%);在严格限制 50 步推理预算的同等条件下与 Claude-4.5-Sonnet(58.1%)差距缩小至 1.4%。EvoCUA-8B 取得 46.1%,击败 OpenCUA-72B,较同样基于 Qwen3-VL-8B 训练的 Step-GUI-8B(40.2%)高 5.9 个百分点。渐进式进化范式分三阶段:冷启动(完备动作空间,按键拆分为 key_down/key_up 以支持 Shift+Click 等持续按压;目标澄清、观测一致性、自我验证、反思与纠错、终止判断五类结构化思维链;后见之明数据合成)、RFT 拒绝采样微调(把 Query 池分难度层级,采样次数 K 分档 {3,8,16,32,64} 阶梯式动态算力分配并设成功率阈值自适应爬坡;用 Judge Model 过滤冗余与错误步骤,Infeasible 任务仅保留最后一步)、面向 Computer Use 的高效 DPO(用成功/失败轨迹对齐定位关键分岔点,构建「动作修正」与「反思与恢复」双范式偏好对)。消融实验:统一动作空间 +4.84%、冷启动 +2.62%、RFT +3.13%、Offline DPO +3.21%、迭代训练 +1.90%。Scaling:RFT 阶段数据量从 20k 扩展到 1M 持续性能爬坡,Max Step 与 Pass@k 均随预算提升。项目已在 GitHub(https://github.com/meituan/EvoCUA)与 Huggingface(EvoCUA-32B、EvoCUA-8B)开源,技术报告以 PDF 形式提供;总结称在超过 100 万卡时的上千组实验中得出高信噪比数据、先验 Pattern 重于数据量、On-Policy 重要性、可视化驱动迭代四条洞察。