论文
WebCraftBench:从软件测试的角度评估 Web 应用程序生成
WebCraftBench: Evaluating Web Application Generation from a Software Testing Perspective
摘要
人工评估可以直接衡量大语言模型生成的网络应用程序的质量。然而,通过自动评估来适应人类判断仍然具有挑战性。静态基准可以信任源代码中存在但在运行时无法访问的功能。交互式基准测试对应用程序进行测试,但不完整的探索可能会导致它们错过已实现的功能,并将应用程序缺陷与代理执行失败混淆。为了解决这些限制,我们提出了 WebCraftBench,这是一种从软件测试角度评估 Web 应用程序生成的交互式基准。 WebCraftBench 检测每个生成的应用程序,并使用代码覆盖率来指导代理通过用户模拟的交互来探索其功能。然后,它将交互跟踪抽象为状态转换图,并从三个维度评估应用程序:视觉美观、可用性和需求一致性。通过将探索与评分分开,WebCraftBench 收集运行时证据,而不将探索限制为预定义的验收标准。 WebCraftBench 包含 369 个现实世界的用户需求和 5,088 个验收标准。对 17 个前沿大语言模型的评估揭示了三个维度上的独特优势,但没有模型在每个维度上都处于领先地位。在从内部竞技场采样的 197 个经过验证的会话中,WebCraftBench 与人类偏好达到 85.3% 的一致性,并且随着配对应用程序之间的分数差异的增加,一致性通常会增加。进一步的实验表明,覆盖指导提高了探索覆盖率,并且当替换判断模型时模型排名保持稳定。