论文
通过受控环境干预构建具有挑战性的浏览器使用任务
Constructing Challenging Browser-Use Tasks by Controlled Environment Interventions
摘要
随着浏览器使用Agent的改进,基准测试通过收集新任务、网站和应用程序来保持同步,通常使任务更长或更新颖。这使得难度更新成本高昂且难以控制:当许多方面同时发生变化时,并不清楚到底是什么使任务具有挑战性。相反,我们从Agent已经解决的任务中构建具有挑战性的实例,将困难转化为环境的可编程属性。 BreakingWeb 将每个基本任务与一个干预条件配对,该干预条件在改变不同 Web 堆栈层的环境时保留用户指令、潜在目标和后端成功标准。每个干预都是确定性的、可检测的、可恢复的,并用它主要加载的认知原语进行注释。该基准包含 7 个自托管网站和 29 个干预家庭的 519 个清洁/干预任务对,所有这些都根据结果进行评分。我们评估了六个强大的浏览器使用Agent、三个只能看到屏幕截图的 GUI Agent和人类。这种结构是有效的:干预措施使智能体平均通过率降低了 22.9%,并推翻了每个智能体干净利落地解决的近一半任务,而人类在第一次尝试时损失了 10.0%,在一次熟悉尝试后损失了 5.7%。主要的失败是信念失败:六个Agent的失败中有 75% 以宣称的成功而告终,尽管所需的改变从未发生。我们的代码、数据和环境可在 www.breakweb.app 上公开获取。