论文
BrowserForge:通过并行浏览器沙箱扩展网页剧集
BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes
摘要
根据渲染像素进行操作的 Web 代理避免了读取页面的 HTML 或可访问性树的脆弱性和沉重的词元成本,但训练它们取决于大量高质量的交互轨迹,并且如何大规模生成此类数据仍然是一个悬而未决的问题。公共数据集通常只包含从一组固定且狭窄的网站中提取的几千个轨迹,甚至最近的自动合成管道也仍然绑定到预定义的站点列表或教程源,因此代理看到的不同网站的数量几乎没有增长。我们推出了 BrowserForge,这是一个通过在开放网络上并行驱动许多浏览器沙箱来大规模生成网络交互数据的框架。 BrowserForge 结合了三个组件:开放网络采购阶段,将代理暴露给数十万个真实的、可公开访问的网站;沙盒集群管理器,可调度数百个高利用率的并发浏览器;提案者-求解器双代理循环将原始页面转换为可执行任务,然后为其收集经过验证的轨迹。规则加模型清理管道会删除失败的运行,并将幸存的推理重写为单一统一的思想链风格。诸如可访问性树之类的页面结构仅用作合成时间信号;我们训练和发布的代理纯粹根据屏幕截图进行操作。生成的语料库包含 203,238 个轨迹,每个轨迹都从不同的网站收集,比之前的轨迹数据集更大、更多样化。该语料库上的紧凑多模态模型 微调 将其在实时 Online-Mind2Web 上的成功率从 25.66% 提高到 33.33%,并持续提高静态 Multimodal-Mind2Web 上的步骤准确性,并且增益随着语料库的扩展而增长。受控分析进一步证实,开放网络采购和广泛的网站覆盖范围是观察到的改善的关键因素。