论文
RESTestBench:根据 NL 需求评估 LLM 生成的 REST API 测试用例有效性的基准
RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements
摘要
现有的 REST API 测试工具通常使用代码覆盖率和基于崩溃的故障指标进行评估。然而,最近基于 LLM 的方法越来越多地根据 NL 需求生成测试来验证功能行为,这使得传统指标无法很好地代理生成的测试是否验证预期行为。为了解决这一差距,我们推出了 RESTestBench,这是一个基准测试,由三个 REST 服务组成,并与精确和模糊变体中手动验证的 NL 需求配对,从而能够对基于需求的测试生成进行受控和可重复的评估。 RESTestBench 进一步引入了基于需求的突变测试指标,该指标测量生成的测试用例相对于特定需求的故障检测有效性,扩展了 Bartocci 等人的基于属性的方法。 。使用 RESTestBench,我们评估了多种最先进的 LLM 中的两种方法:(i) 基于非细化的生成,以及 (ii) 通过与正在运行的 SUT 交互引导的基于细化的生成。在细化实验中,RESTestBench 评估实际实现(有效或变异)如何影响测试有效性。我们的结果表明,当生成器与错误或变异的代码交互时,测试有效性会显着下降,特别是对于模糊的需求,有时会抵消细化的好处,并表明当需求细节很高时,没有必要合并实际的 SUT 行为。