论文

Weblica:面向视觉网页智能体的可扩展可复现训练环境

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

AI 基础设施模型训练强化学习数据基础设施Agentic RL

摘要

网络复杂、开放且持续变化,使视觉网页智能体的训练数据扩展充满挑战。既有数据收集尝试仍限于离线轨迹(供SFT)或少数仿真环境(供RL训练),未能捕捉网络的多样性。我们提出Weblica(Web Replica):构建可复现、可扩展网络环境的框架。框架利用(1) HTTP级缓存捕捉并重放稳定的视觉状态、同时保留交互行为,(2) 扎根真实网站与核心网页导航技能的LLM环境合成。用该框架我们把RL训练扩展到数千个多样环境与任务。我们的最佳模型Weblica-8B在多个网页导航基准上超越同规模开放权重基线,同时使用更少推理步,随测试时算力增加而良好扩展,并与API模型具有竞争力。

Weblica:面向视觉网页智能体的可扩展可复现训练环境:论文配图
图 1:由于网络的复杂性、动态性和开放性,扩展可视化网络代理的训练数据具有挑战性。左:我们以完全自动化和可扩展的方式综合生成 Web 环境,涵盖导航、表单填写、过滤、日期选择等一系列广泛的功能。除了缓存真实网站之外,这些还为实时网络训练创建了完全离线的替代方案。右图:在这些环境上进行训练可以提高多个 Web 导航基准的性能(此处显示的 Online-Mind2Web [Xue 等人,2025]),并根据测试时计算(顶部)和模型大小(底部)进行扩展。