论文
通过自动数据生成与细粒度评估扩展 Web Agent 训练
Scaling Web Agent Training through Automatic Data Generation and Fine-grained Evaluation
摘要
我们提出了一条用于自动生成 Web Agent 高质量训练数据的可扩展流水线。其中,识别高质量训练实例的一大挑战是轨迹评估——量化任务完成取得了多少进展。我们提出一种新颖的基于约束的评估框架,可对任务完成进度进行细粒度评估。这使得我们能够利用部分成功的轨迹,从而显著扩大可用训练数据的规模。我们在自建的新基准 BookingArena 上评估该方法,该基准由覆盖 20 个热门网站的复杂预订任务组成;结果显示,我们的蒸馏学生模型优于开源方法,并能比肩或超越商业系统,同时模型规模显著更小。我们的工作应对了高效创建多样、真实 Web 交互数据集的挑战,并为复杂结构化 Web 任务提供了系统化的评估方法。
