论文

关于从代码生成需求的可行性:经验报告

On the Viability of Requirements Generation From Code: An Experience Report

模型评测模型能力评测

摘要

由于缺乏将源代码与相应需求配对的足够数据集,需求工程的实证研究受到阻碍。解决这一缺陷的一个诱人途径是使用 大语言模型 来综合现有代码库的需求。我们通过评估基于 LLM 和 RAG 支持的代理方法来研究这个问题,该方法从源代码生成需求,依靠人机循环验证其实现状态,并综合引入需求气味和未实现的需求。我们的目标是创建模仿现实的数据集并促进实证可再生能源研究。但在研究过程中,出现了各种问题,才有了这份经验报告。与我们最初的假设相反,LLM 无法(i)可靠地生成未实现的需求,(ii)生成高质量的需求,以及(iii)可靠地引入合成需求气味。此外,LLM 和单个人在环中都不足以可靠地检测需求气味。这些发现表明,使用 LLM 生成代码到需求数据集尚不可行,需要人工监督,特别是在质量保证方面。我们批判性地反思我们所吸取的教训,并为研究人员和从业者得出相关结论。