论文
GTA:大规模生成Web智能体的长时程任务
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
摘要
将语言模型与浏览和工具使用能力相结合的Web智能体,展现出成为开放网络助手的潜力。然而,进展日益受限于可扩展的过程级监督的缺失。现有基准大多人工构建,只提供粗糙的起始-目标标注而无中间轨迹,而近期的自动生成工作仍然昂贵、有偏且浅层。这些局限阻碍了对必须泛化到真实、多跳、跨页任务的智能体进行可靠训练与评估。我们提出可扩展框架GTA,它整合爬取、基于检索的种子选取、上下文内生成和自动化质量控制,以产生配对可执行轨迹的真实任务。该设计将爬取与生成分离以提高效率,把任务锚定在站点图上以强制保证组合性,并通过确定性回放和系统性校验来确保密集监督。我们在覆盖电商、政府、论坛和新闻的50多个网站上实例化该流水线,具备多语言与多跳覆盖。由此得到的基准揭示了显著的人机性能差距,并支持细致的诊断。我们的贡献有三:(i)将多跳Web智能体任务生成形式化,(ii)提出高效且经验证的自动数据创建流水线,(iii)发布带有可复现评估的动态基准。
