论文

Echoverse:面向大规模训练计算机操作智能体的深度演化环境

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

模型评测模型训练强化学习基准与评测资源Agentic RL

摘要

计算机操作(computer-use)智能体从其动作所改变的东西中学习,因此训练这样的智能体需要可供其操作、破坏和重置的应用程序。最重要的应用程序都有登录门槛且带状态,因此只能以合成环境替代。近来的流水线批量生成此类环境,这使瓶颈从环境有多少转移到每个环境里有什么。我们发现,回报来自三个性质:环境承载多少行为深度,它是否瞄准智能体实际失败的交互,以及它是否随模型一同改进。我们提出Echoverse,它将规格说明编译为带状态的应用程序,其任务依据应用程序自身的数据库进行评分,并配备一个共同演化回路,对每次被评分的rollout读取两遍:一遍作为对环境、其任务及其验证器的修复,一遍作为模型的训练信号。在十二个这样的环境上训练后,一个9B模型在十四个评测切分上从36.5%提升到67.1%,与训练它的那个大得多的前沿模型相差十四个百分点以内。我们逐一检验上述三个性质。在相同领域上,浅层环境使真实站点准确率降到基座模型之下(80.0降至75.0),而深层环境使其提升(80.0升至85.0,以及48.0升至65.0);把一个界面控件在多种渲染上反复练习,可迁移到留出的控件族乃至开放网络;修复单个环境使在其上训练的模型从16.2%提升到38.5%。同样的世界还可作为强化学习环境,其中将锚定验证器与逐步密集裁判相结合的奖励,把留出分数从58.8%提升到68.0%。我们发布四个环境作为基准,附带其应用程序、种子数据和锚定评分器。代码:https://aka.ms/echoverse

Echoverse:面向大规模训练计算机操作智能体的深度演化环境:论文配图
图 1:学习循环。每个评分的运行都会阅读两次。分类中幸存下来的故障成为模型训练数据;环境、其任务或验证者中的缺陷将被修复。衡量模型的相同分级运行也使世界更加清晰。