论文
Weblica:面向视觉网页智能体的可扩展可复现训练环境
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
摘要
网络复杂、开放且持续变化,使视觉网页智能体的训练数据扩展充满挑战。既有数据收集尝试仍限于离线轨迹(供SFT)或少数仿真环境(供RL训练),未能捕捉网络的多样性。我们提出Weblica(Web Replica):构建可复现、可扩展网络环境的框架。框架利用(1) HTTP级缓存捕捉并重放稳定的视觉状态、同时保留交互行为,(2) 扎根真实网站与核心网页导航技能的LLM环境合成。用该框架我们把RL训练扩展到数千个多样环境与任务。我们的最佳模型Weblica-8B在多个网页导航基准上超越同规模开放权重基线,同时使用更少推理步,随测试时算力增加而良好扩展,并与API模型具有竞争力。
