论文
关于需求味道对基于 LLM 的代码生成的影响
On the Impact of Requirement Smells in LLM-Based Code Generation
摘要
软件需求通常被纳入大语言模型辅助软件开发中使用的提示中。最近的工作表明,需求气味会影响需求和代码之间的自动可追溯性,但其对代码生成影响的经验证据仍然有限。为了解决这一差距,我们通过重用其数据集和需求气味分类法,建立在先前关于自动可追溯性的研究的基础上,同时扩展它以评估 LLM 生成的代码的功能正确性。使用由四个应用程序的需求和相应系统测试组成的基准,我们逐步将语义、句法和词汇气味引入到其他明确的需求中,并分析它们对生成的实现的影响。我们的结果表明,增加 \textit{气味密度} 通常与较低的基于测试套件的功能正确性相关,尽管无气味的要求仍然可能产生错误的代码。我们还发现不同的气味类别具有相似的效果。这些发现提供了额外的经验证据,证明了需求质量在大语言模型辅助代码生成中的重要性,同时表明,高质量的需求本身并不能保证正确性,因为这取决于包括大语言模型在内的几个因素。与以前的工作相比,我们的结果表明,需求气味的影响取决于软件工程任务:虽然它们对可追溯性的影响不大,但代码生成似乎更敏感。总体而言,这项工作激发了对大语言模型辅助软件工程中任务相关质量效应的进一步研究。