OpenWebRL:揭秘可视化 Web 代理的在线多轮强化学习
OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents
摘要
构建强大的视觉网络代理需要长期推理、精确的基础以及与动态现实世界网站的稳健交互。尽管进展迅速,最强大的系统在很大程度上仍然是专有的,而开放代理仍然严重依赖于受监督的 后训练 大量精选的网络轨迹。这种依赖性造成了主要的可扩展性瓶颈:收集高质量的演示成本高昂,而静态数据集对多样化、不断变化的开放网络的覆盖范围有限。尽管在线强化学习已显示出基于文本代理的前景,但其直接在实时网站上训练视觉网络代理的潜力仍然很大程度上尚未得到充分开发。在本文中,我们介绍了 OpenWebRL,这是一个开放框架,用于在真实网站上使用在线多轮强化学习来训练视觉网络代理。 OpenWebRL 涵盖了完整的训练流程,包括可扩展的实时浏览器基础设施、监督初始化、多模式上下文管理、轨迹级成功判断和高效的多轮策略优化。使用这个框架,我们训练 OpenWebRL-4B,它在具有挑战性的实时网络基准方面建立了新的开源技术水平。仅凭借 0.4K 初始化轨迹和 2.2K 开放式 RL 训练任务,OpenWebRL-4B 在 Online-Mind2Web 上取得了 67.0% 的成功率,在 DeepShop 上取得了 64.0% 的成功率,超越了之前类似或更大规模的开放代理,并与包括 OpenAI CUA 和 Gemini CUA 在内的专有系统保持了竞争力。除了强大的基准性能之外,我们还系统地研究了使在线强化学习对视觉网络代理有效的关键设计选择,并分析了强化学习如何改进代理推理。总的来说,我们的工作为构建更有能力、可重复性和成本效益更高的开放网络代理提供了一条实用的途径。我们将发布我们的训练数据、模型和代码以支持未来的研究。