论文

通过自动数据生成与细粒度评估扩展 Web Agent 训练

Scaling Web Agent Training through Automatic Data Generation and Fine-grained Evaluation

模型训练合成数据

摘要

我们提出了一条用于自动生成 Web Agent 高质量训练数据的可扩展流水线。其中,识别高质量训练实例的一大挑战是轨迹评估——量化任务完成取得了多少进展。我们提出一种新颖的基于约束的评估框架,可对任务完成进度进行细粒度评估。这使得我们能够利用部分成功的轨迹,从而显著扩大可用训练数据的规模。我们在自建的新基准 BookingArena 上评估该方法,该基准由覆盖 20 个热门网站的复杂预订任务组成;结果显示,我们的蒸馏学生模型优于开源方法,并能比肩或超越商业系统,同时模型规模显著更小。我们的工作应对了高效创建多样、真实 Web 交互数据集的挑战,并为复杂结构化 Web 任务提供了系统化的评估方法。

通过自动数据生成与细粒度评估扩展 Web Agent 训练
图1:概览。我们引入了一个可扩展的流水线,用于自动生成和评估 web agent 轨迹,以训练有能力的小型语言模型(第 2.1 节)。给定由少样本提示的教师智能体生成的轨迹,我们新颖的基于约束的细粒度评估框架(第 2.2 节)为蒸馏提取高质量的训练实例。详情见正文。