论文
用于需求工程的 大语言模型:跨任务实证评估
Large Language Models for Requirements Engineering: A Cross-Task Empirical Evaluation
摘要
与需求相关的信息分散在异构的人工制品中,例如用户反馈、开发人员讨论和软件存储库,使得提取可操作的需求知识成为劳动密集型且难以扩展。 大语言模型 (LLM) 可以支持许多需求工程 (RE) 活动,从分类和可追溯性识别到规范和解释生成,但现有证据在任务、工件类型和评估设置中分散,并且研究很少提供跨任务评估或复制包。我们提出了两项互补的实证研究,评估了五种 RE 相关活动中的 LLM。第一个是对五个轻量级开源 LLM 进行的受控实验,用于反馈驱动的需求分类和规范生成。第二个是对两个前沿 LLM 的探索性工业案例研究,用于使用真实项目工件进行追溯链接识别和追溯解释生成。分类和可追溯性识别通过定量指标进行评估,并通过人工评估生成任务。 LLM 的性能强烈依赖于任务,范围从中等到高,并且没有任何一个模型始终优于其他模型,这表明有效采用取决于选择模型和每个任务的提示策略。我们的贡献是:(i) 对 LLM 的首次跨任务实证评估,涵盖五个 RE 相关活动,(ii) 支持再现性的复制材料,以及 (iii) 对当前 LLM 用于 RE 的功能、局限性和实际准备情况有更广泛的了解。