论文

WebRetriever:高效Web Agent评估的大规模综合基准

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

智能体系统Agent任务评测

摘要

随着网络代理越来越多地展示自动化任务执行的能力,开发用于评估其导航和任务完成性能的强大评估框架已成为关键的研究重点。然而,现有的基准表现出根本的局限性。首先,它们的规模不足和领域多样性有限,限制了跨领域泛化的综合评估。其次,流行的 LLM-as-Judge 评估方法不足以捕获细粒度的交互语义,特别是在精确的查询制定和过滤操作方面。第三,当前的基准主要强调导航成功指标,而忽略了现实部署场景的关键要求。为了解决这些限制,我们引入了 WebRetriever,这是一个大型基准测试,涵盖跨不同领域(包括消费者、专业和企业部门)的 800 个网站和 1,550 个任务,全面覆盖用户意图模式。我们提出了 NavEval(导航评估),这是一种新颖的 LLM-as-Judge 框架,它利用视觉屏幕截图之外的丰富交互上下文,在多个评估数据集上实现与人类判断的最先进的一致性。此外,我们建立了三个互补的评估协议,共同提供对网络代理能力的整体评估:导航熟练程度、知识辅助交互以及通过信息提取完成端到端任务。广泛的实验分析揭示了评估协议之间巨大的性能差异,表明导航成功本身并不足以预测现实世界的应用程序有效性。 WebRetriever 提供对代理功能的细粒度诊断见解,并为推进 Web 代理研究和开发奠定了坚实的基础。