论文

WebTestBench:评估计算机使用代理以实现端到端自动化 Web 测试

WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 的出现促进了编程范式的转变,催生了“vibe 编码”,用户可以构建完整的项目,甚至使用自然语言指令控制计算机。这种范式推动了自动化网页开发,但它引入了关于如何自动验证 Web 功能是否可靠实现的新要求。现有的作品很难适应,依赖于静态视觉相似性或预定义的清单,限制了它们在开放环境中的实用性。此外,他们忽视了软件质量的一个重要方面,即潜在的逻辑约束。为了解决这些差距,我们引入了 WebTestBench,这是一个评估端到端自动化 Web 测试的基准。 WebTestBench 涵盖不同 Web 应用程序类别的综合维度。我们将测试过程分解为两个级联的子任务,检查表生成和缺陷检测,并提出 WebTester,这是该任务的基线框架。使用 WebTester 评估流行的 LLM 揭示了严峻的挑战,包括测试完整性不足、检测瓶颈和长期交互不可靠性。这些发现揭示了当前计算机使用代理能力与工业级部署需求之间的巨大差距。我们希望 WebTestBench 为推进端到端自动化 Web 测试提供有价值的见解和指导。我们的数据集和代码可在 https://github.com/friedrichor/WebTestBench 获取。