论文

MolmoWeb:开放视觉网络代理和开放网络的开放数据

MolmoWeb: Open Visual Web Agent and Open Data for the Open Web

智能体系统Agent 架构与控制循环

摘要

网络代理(代表用户在网络上导航和执行任务的自治系统)有可能改变人们与数字世界的交互方式。然而,当今最有能力的网络代理依赖于具有未公开的训练数据和配方的专有模型,限制了科学理解、可重复性和社区驱动的进步。我们认为开放网络的代理应该在开放的环境中构建。为此,我们介绍 (1) MolmoWebMix,一个浏览器任务演示和 Web-GUI 感知数据的大型且多样化的混合体,以及 (2) MolmoWeb,一系列完全开放的多模式 Web 代理。具体来说,MolmoWebMix 将来自多个互补生成管道的超过 100K 合成任务轨迹与 30K 多个人类演示、原子网络技能轨迹和 GUI 感知数据相结合,包括引用表达基础和屏幕截图问答。 MolmoWeb 代理按照指令条件的视觉语言操作策略运行:给定任务指令和网页屏幕截图,它们预测下一个浏览器操作,不需要访问 HTML、可访问性树或专门的 API。 MolmoWeb 代理有 4B 和 8B 大小可供选择,在 WebVoyager、Online-Mind2Web 和 DeepShop 等浏览器使用基准测试中,MolmoWeb 代理实现了最先进的结果,优于类似规模的仅开放权重模型(如 Fara-7B、UI-Tars-1.5-7B 和 Holo1-7B)。 MolmoWeb-8B 还超越了基于 GPT-4o 等更大的封闭边界模型构建的标记集 (SoM) 代理。我们进一步证明了通过并行轨迹采样和最佳 N 选择来实现测试时间扩展的一致收益,在 WebVoyager 和 Online-Mind2Web 上分别实现了 94.7% 和 60.5% pass@4(相比之下,78.2% 和 35.3% pa​​ss@1)。我们将发布模型检查点、训练数据、代码和统一的评估工具,以实现可重复性并加速网络代理的开放研究。