论文

WebFactory:将基础语言智能自动压缩为依据对齐Web Agent

WebFactory: Automated Compression of Foundational Language Intelligence into Grounded Web Agents

模型训练强化学习

摘要

当前训练GUI Agent的范式从根本上受限于对不安全、不可复现的真实网页交互,或昂贵、稀缺的人工构造数据与环境的依赖。我们认为这种对数据量的关注忽视了一个更关键的因素:将大语言模型(LLM)的潜在知识压缩为可执行Agent行为的效率。我们提出WebFactory,一个新颖的全自动闭环强化学习流水线,系统地把LLM编码的互联网智能压缩为高效、基于界面定位的动作。该流水线包含可扩展的环境合成、知识感知的任务生成、LLM驱动的轨迹收集、分解奖励的RL训练和系统化的Agent评估。值得注意的是,我们的Agent展现出卓越的数据效率和泛化能力。仅在WebFactory内10个网站的合成数据上训练,它的表现就与在更大范围环境中用同等数量人工标注数据训练的GUI Agent相当。这一优势在我们的内部离线和在线迁移基准上保持一致,我们的Agent还显著优于基础模型。我们进一步提供了对不同LLM基础"具体化潜力"的关键洞见,为模型评估提供了新轴。这项工作提出了一种将被动互联网知识转化为主动、基于界面证据的智能的可扩展、高性价比范式,是迈向通用交互Agent的关键一步。

WebFactory:将基础语言智能自动压缩为接地Web Agent
图3:使用不同基础模型生成的数据所训练的智能体在各公开GUI基准上的性能比较。结果展示了 GUI-Act-Web ( Chen et al., 2024 ) 、GUI-Odyssey ( Lu et al., 2024 ) 、OmniAct-Desktop ( Kapoor et al., 2024 ) 、OmniAct-Web测试以及ScreenSpot各类别(desktop-text、desktop-icon、mobile-text、mobile-icon、web-text、web-icon)上的Type准确率、步骤完成率与Grounding准确率。GPT-5在大多数指标上持续取得最高性能,展现出卓越的数据生成质量与智能压缩能力。