论文

Fara-1.5:面向计算机操作Agent的可扩展学习环境

Fara-1.5: Scalable Learning Environments for Computer Use Agents

模型训练合成数据

摘要

从人类示范收集计算机使用数据昂贵缓慢——促使需要可扩展生成策略。这需要两个关键要素:智能体可行动的环境——以及能判断其示范是否成功的验证器。我们介绍FaraGen1.5——面向计算机使用智能体的可扩展数据管线——由三个模块化组件构成:环境、求解器与验证器。FaraGen1.5同时使用真实网站与忠实仿真被认证门控或需不可逆动作领域的合成环境。它采用可由多模型驱动(含GPT-5.4等强前沿模型)的求解器运行框架——并纳入用户模拟器以支持多轮执行轨迹。最后——FaraGen1.5以三个互补验证器为所得轨迹打分——覆盖任务正确性、效率与关键点遵循。使用该管线产出的数据——我们训练Fara1.5——建立在Qwen3.5上、三个规模(4B、9B、27B)的原生计算机使用智能体(CUA)家族。为训练这些模型——我们采用监督微调(SFT)配方——以迭代方式仔细平衡来自FaraGen1.5的广覆盖数据、特定高价值任务与目标模型缺陷。每个模型都在其规模类的浏览器使用基准上创下新SOTA:Fara1.5-9B在Online-Mind2Web达63.4%、WebVoyager达86.6%——Fara1.5-27B在Online-Mind2Web达72.3%——与更大得多的专有系统竞争。我们还在MIT许可下发布Fara1.5模型权重——使SOTA计算机使用超越仅闭源API系统、人人可得。

Fara-1.5:计算机使用智能体的可扩展学习环境:论文配图
图 1:类似大小的 CUA 模型在 Online-Mind2Web 和 WebVoyager 上的任务成功率。 Fara1.5-9B 在 Online-Mind2Web 上达到 63.4%(比 Fara-7B(Awadallah 等人,2025)提高了 29.3 点,比该规模的先前最佳 GUI-Owl-1.5-8B 提高了 14.8 点),在 WebVoyager 上达到了 86.6%,在两个基准测试中为 8-9B 尺寸类别设定了新的技术水平。