CUA-Gym:为计算机使用智能体扩展可验证的训练环境与任务
CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
摘要
可验证奖励强化学习(RLVR)已在数学、工具使用和软件工程等领域推动突破,但其向计算机使用智能体(CUA)的扩展一直受限于缺乏具有确定性奖励的可扩展训练数据。为CUA构建这类数据需要一致的任务指令、可执行的环境和可验证的奖励。然而,人工策划的基准奖励保真度高但覆盖应用少,而基于LLM-as-judge的数据集规模大但缺乏可靠验证。我们提出CUA-Gym,一个协同生成任务指令、环境状态和奖励函数的可扩展流水线。具体而言,一个Generator智能体构建初始与黄金环境状态,另一个独立的Discriminator智能体根据任务规范撰写奖励函数。一个orchestrator智能体在执行后驱动二者进行多轮迭代。生成的元组随后通过一个结合LLM多数投票与智能体rollout的最终过滤器,确保质量超越单任务对抗循环。为解决训练环境的稀缺,我们进一步合成了CUA-Gym-Hub,一套基于真实软件使用分布的高保真模拟Web应用套件,将CUA RLVR数据的规模扩大了一个数量级。利用该流水线,我们构建了CUA-Gym数据集,包含32,112条经核验的RLVR训练元组,基于110个环境。用GSPO在CUA-Gym上训练,我们的CUA-Gym-A3B和CUA-Gym-A17B在OSWorld-Verified上分别取得62.1%和72.6%的成绩,超过同等规模的先前开源CUA,且性能随数据量和环境多样性平滑扩展。同一检查点在留出的WebArena基准上也有提升,表明能迁移到训练环境之外。我们将开源完整的合成流水线、数据集、CUA-Gym-Hub环境和模型。
