论文

WebPageBench:Web Agent的事件级验证和受控 UI 变体生成

WebPageBench: Event-Level Verification and Controlled UI-Variant Generation for Web Agents

智能体系统Agent任务评测

摘要

我们提出了 WebPageBench,这是一个用于评估 Web Agent的开放框架,其中每个任务都通过界面自己的事件日志进行验证。六个删除了品牌标识符的仪表化模拟站点(市场、书店、杂货服务、铁路票务、酒店搜索和文件柜)在用户或Agent执行操作时发出带有参数的类型化事件。任务声明它需要的事件,通过匹配它们来决定成功,没有判断模型,也没有抓取渲染页面。相同的工具支持受控的 UI 变化:一个配置开关通过单个控件的不同实现重新呈现任务,而提示和成功条件保持完全相同,因此可以在固定的任务规范下测量对界面形式的敏感度。 WebPageBench 版本由三个组件组成:152 个任务,分为 65 个规范场景和 87 个跨明/暗 UI 模式的控制变体;使用 6 个浏览器/DOM Harness配置和 5 个仅屏幕截图的 GUI Agent系列对普通运行程序进行评估;以及 24 个模型Harness对的公共排行榜。在公开的 152 项任务排行榜上,Agent声明完成的内容与日志确认的内容之间的差距达到41个百分点(一种配置声明每项任务已完成并满足条件的比例为 59%)。