论文
史诗般的组织与需求一致的小黄瓜:基于 LLM 的验收标准生成的实证评估
Epic-Organized vs. Requirement-Aligned Gherkin: An Empirical Evaluation of LLM-Based Acceptance Criteria Generation
摘要
自动编写 Gherkin 行为驱动开发 (BDD) 验收标准仍然是需求工程中的手动瓶颈。本研究调查了史诗组织的 LLM 生成的 Gherkin 是否比符合需求的生成生成更高的质量和覆盖范围。我们将 Timeless(史诗般组织的 LLM 管道)方法与朴素的 大语言模型 (LLM) 基线对 PURE 数据集中的四个需求文档(107 个需求)进行比较。评估涵盖结构指标、通过 TF-IDF 和密集嵌入实现的自动化需求覆盖,以及四位研究人员的盲专家评估。在我们的评估中,JSON 约束的管道在所有生成的输出中生成了结构有效的场景,而零样本基线实现了 99% 的结构有效性。语义覆盖率与基线相当,Timeless 实现了 94.3% 的语义需求覆盖率,而基线为 92.9%。 TF-IDF 为史诗组织的输出产生了较低的覆盖率分数,这表明当场景在更高抽象级别解释要求时,词汇度量可能会错过覆盖率。专家评估者在正确性(4.61 vs 4.14)、可执行性(4.61 vs 4.07)和完整性(4.31 vs 3.50)方面更喜欢史诗般的组织策略。总体而言,结果表明,史诗般的组织生成可以提高感知的小黄瓜质量,同时保持可比的语义覆盖范围,尽管在推广这一发现之前需要更广泛的复制。