论文

GTA:大规模生成Web智能体的长时程任务

GTA: Generating Long-Horizon Tasks for Web Agents at Scale

智能体系统Agent任务评测

摘要

将语言模型与浏览和工具使用能力相结合的Web智能体,展现出成为开放网络助手的潜力。然而,进展日益受限于可扩展的过程级监督的缺失。现有基准大多人工构建,只提供粗糙的起始-目标标注而无中间轨迹,而近期的自动生成工作仍然昂贵、有偏且浅层。这些局限阻碍了对必须泛化到真实、多跳、跨页任务的智能体进行可靠训练与评估。我们提出可扩展框架GTA,它整合爬取、基于检索的种子选取、上下文内生成和自动化质量控制,以产生配对可执行轨迹的真实任务。该设计将爬取与生成分离以提高效率,把任务锚定在站点图上以强制保证组合性,并通过确定性回放和系统性校验来确保密集监督。我们在覆盖电商、政府、论坛和新闻的50多个网站上实例化该流水线,具备多语言与多跳覆盖。由此得到的基准揭示了显著的人机性能差距,并支持细致的诊断。我们的贡献有三:(i)将多跳Web智能体任务生成形式化,(ii)提出高效且经验证的自动数据创建流水线,(iii)发布带有可复现评估的动态基准。

GTA:大规模生成Web智能体的长时程任务:论文配图
图 1:跨数据集的页面覆盖率比较。与之前的数据集(例如 AgentTrek (20.2%)、NNetNav (24.3%) 和 WebDS (11.0%) 相比),我们提出的基准 (GTA) 实现了更高的页面覆盖率 (77.4%–80.7%)。这表明GTA任务运用了更广泛的站点功能,体现了更强的信息来源能力。 AgentTrek 的统计数据在 espn.com、NNetNav 的 underarmour.com 和 WebDS 的 casper.com 上计算。