论文
SCALECUA:以可验证任务合成与高效在线RL扩展计算机使用智能体
SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL
摘要
计算机使用智能体(CUA)正成为经视觉感知与GUI执行自动化复杂数字工作流的强大界面。带可验证奖励的在线强化学习(RLVR)是扩展其能力的关键方向,但该范式受制于可验证数据稀缺与在线RL低效。为打破这些障碍,我们提出ScaleCUA:经可验证任务合成与高效训练扩展CUA在线RL的统一框架。数据层面:我们设计VeriGen——经迭代Docker交互与多智能体反馈回路生成可验证RL任务的端到端框架;经共享Docker交互探针扩展到100+并发智能体工作者,该管线产出2.4万+可验证任务与近3千高质量RL任务。为最大化样本效率,我们提出前沿采样:跟踪逐任务能力、把rollout分配到当前学习前沿。训练侧:我们进一步设计视觉上下文分段——近期视觉上下文上的滑窗,平衡rollout与训练引擎压力,较逐步分解取得2.83倍训练加速。合计ScaleCUA在OSWorld取得68.7%、ScienceBoard取得54.0%,确立开源计算机使用智能体的新最先进表现。代码、模型与数据集见https://github.com/THUDM/SCALE-CUA。
