论文

CUA-Sandbox:计算机使用Agent强化学习的高效环境

CUA-Sandbox: Efficient Environments for Computer-Use Agent Reinforcement Learning

AI 基础设施模型训练强化学习SandboxAgentic RLAgent Sandbox

摘要

强化学习使计算机使用Agent能够通过与真实软件环境(包括网站和桌面应用程序)的交互来改进。然而,即使轨迹使用相同的软件,传统的部署也会为每个独立的部署复制初始化的运行时,随着并行环境数量的增长,会产生重复的内存和初始化成本。独立的计算机使用环境是否需要独立的执行运行时?我们的主要观察结果是,轨迹需要独立的可变状态,而初始化的应用程序运行时可以在并发发展的环境中重用,使状态成为环境独立性的自然单元。在此观察的指导下,我们引入了 CUA-Sandbox,它通过状态范围的执行和事务生命周期操作(包括重置和分支)将私有状态胶囊与共享运行时分开,同时保留原始软件接口和任务评估器。实验表明,相对于 Docker,任务成功率相当或有所提高,同时大幅降低了部署和资源成本。 CUA-Sandbox 的rollout吞吐量提高了 6.20 倍,每个环境内存减少了 9.2 倍,增量存储减少了 504 倍。