论文

SCALECUA:以可验证任务合成与高效在线RL扩展计算机使用智能体

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

模型训练强化学习RLVRAgentic RL

摘要

计算机使用智能体(CUA)正成为经视觉感知与GUI执行自动化复杂数字工作流的强大界面。带可验证奖励的在线强化学习(RLVR)是扩展其能力的关键方向,但该范式受制于可验证数据稀缺与在线RL低效。为打破这些障碍,我们提出ScaleCUA:经可验证任务合成与高效训练扩展CUA在线RL的统一框架。数据层面:我们设计VeriGen——经迭代Docker交互与多智能体反馈回路生成可验证RL任务的端到端框架;经共享Docker交互探针扩展到100+并发智能体工作者,该管线产出2.4万+可验证任务与近3千高质量RL任务。为最大化样本效率,我们提出前沿采样:跟踪逐任务能力、把rollout分配到当前学习前沿。训练侧:我们进一步设计视觉上下文分段——近期视觉上下文上的滑窗,平衡rollout与训练引擎压力,较逐步分解取得2.83倍训练加速。合计ScaleCUA在OSWorld取得68.7%、ScienceBoard取得54.0%,确立开源计算机使用智能体的新最先进表现。代码、模型与数据集见https://github.com/THUDM/SCALE-CUA。

SCALECUA:以可验证任务合成与高效在线RL扩展计算机使用智能体:论文配图
图 3:ScaleCUA 概述。 VeriGen 自动合成可验证的 GUI 任务,并从 100 多个并行工作线程规模的实时操作系统环境中获得可执行奖励;与上游前沿采样和长视野视觉上下文分割相结合,ScaleCUA 为计算机使用代理提供高效的大规模在线 RL。