论文

Web 开发中代码驱动代理测试的框架和基准

Framework and Benchmark for Code-Driven Agentic Testing in Web Development

智能体系统Agent任务评测

摘要

端到端 GUI 测试对于验证 Web 应用程序至关重要,但现有的评估依赖于预定义的检查表,并且仅限于 Web 生成基准的数据和框架,使得视觉语言模型 (VLM) 的错误发现能力未经系统测试。我们引入 \textbf{C}ode 驱动的 \textbf{A}gentic \textbf{T}esting (CAT),这是一种代理编写 Playwright 代码来驱动浏览器、收集反馈并自主探索 Web 应用程序以发现错误的范例。我们用 CATJudge 实例化 CAT,CATJudge 是一个代理框架,将浏览器使用和计算机使用工具统一在一个环境中,而 CATTest 是 102 个 AI 生成的 Web 应用程序的基准,带有仔细注释的错误,通过密切的人类与 AI 协作构建,具有复杂的交互和微妙的缺陷。主流 VLM 的实验表明,所有评估的模型都表现不佳,揭示了当前 VLM 功能与 AI Web 开发中的实际测试需求之间存在明显差距。我们在 https://github.com/SleepyWithoutCoffee/CATJudge 发布了我们的代码和数据。