论文

不假定清晰度:了解模糊要求下基于 LLM 的代码生成

Clarity Is Not Assumed: Understanding LLM-Based Code Generation under Ambiguous Requirements

模型评测基准与评测资源

摘要

软件需求模糊性在现实世界的开发中普遍存在,其根源在于自然语言固有的不精确性和利益相关者的不同解释。虽然 大语言模型 (LLM) 在根据精确规范生成代码方面表现出了令人印象深刻的能力,但这种模糊性对可靠的自动代码生成构成了重大障碍。现有的基准通常假设明确且明确的需求,在理解 LLM 在面对现实世界软件需求的固有不确定性时如何表现方面存在经验差距。在本文中,我们介绍 Orchid,这是第一个专门针对不明确的需求而设计的代码生成基准测试。它包含 1,304 个功能级任务,涵盖四种不同类型的歧义:词汇、句法、语义和模糊性。利用该数据集,我们进行了首次系统的实证研究,以评估需求模糊性对基于 LLM 的代码生成的影响。我们的结果表明,模糊性始终会降低所有评估的 LLM 的性能,在高度先进的模型中观察到最明显的负面影响。此外,我们观察到 LLM 经常针对相同的模糊要求产生功能上不同的实现,并且缺乏自主识别或解决此类模糊性的能力。这些发现揭示了明确需求和模糊需求之间存在显着的性能差距,强调了下一代自动化软件工程工具迫切需要模糊感知技术。 Orchid 基准测试可在 https://huggingface.co/datasets/SII-YDD/Orchid 上公开获取。