Qwen-CUA:本机计算机用于(几乎)一切
Qwen-CUA: Native Computer Use for (almost) Everything
摘要
本机计算机的使用为代理提供了一个通用界面,可以操作人们几乎可以使用的任何软件,但需要长期状态跟踪、大规模交互体验以及从稀疏但可验证的结果中学习。我们引入了 Qwen-CUA,这是一种具有 397B-A17B Qwen 专家混合骨干的本机计算机使用代理。它仅观察屏幕截图并通过键盘和鼠标事件进行操作,没有 DOM 树、可访问性元数据或特定于任务的 API。它的脚手架可维护多达 20 个活动屏幕截图,并将旧的视觉历史记录折叠在固定大小的块中,以保留最新的证据,同时保留可重复使用的提示前缀。对于训练,我们构建了一个云端轨迹采样集群,可以访问近 100,000 个 vCPU 和数万个并发环境,构建大约 40,000 个可验证任务,并跨日常和专业软件收集个性化的长期工作流程。我们通过可验证的奖励和轨迹切片来优化完整的轨迹,而迭代训练运行会刷新监督数据并重新校准强化学习任务。在八个基准测试中,Qwen-CUA 的性能优于 Qwen3.7,并且与领先的专有系统保持竞争力,在 OSWorld 验证上达到 86.2,在 OSWorld 2.0 上达到 18.5/48.4 二进制/部分完成。将相同的配方扩展到具有超过一万亿个参数的模型会产生 Qwen-CUA-Max,将这些分数提高到 87.6 和 21.2/53.3。相对于 Qwen3.7,Qwen-CUA 还将 RedTeamCUA 攻击成功率从 36.6 降低到 16.4。效率分析、浏览器执行轨迹和 Bash 增强实验进一步表征了实际行为。这些结果将本机计算机的使用确立为具有广泛能力的代理基础,并强调可扩展的可验证交互和混合工具的使用作为关键方向。