论文
基于 ISO 的 NFR 规范是否可以改进 LLM 代码生成?丰富且结构化的干预措施与自然语言基线的比较
Does ISO-Grounded NFR Specification Improve LLM Code Generation? A Comparison of Rich and Structured Interventions against a Natural-Language Baseline
摘要
在基于 LLM 的代码生成中,非功能性需求 (NFR) 通常被指定为简洁的一行短语。我们询问,与 RobuNFR 风格的单行基线(NL-simple)相比,将这些规范作为丰富的自然语言散文(NL-rich)或结构化 JSON(Structured)建立在 ISO/IEC 25010 质量模型中是否可以改进在 HumanEval/HumanEval-ET 上生成的代码。我们在固定模型快照和配对非参数分析下评估了四种 NFR(性能、错误处理、代码气味、可读性),每种条件有十种提示变化。主要发现:基于 ISO 的充实提高了静态质量代理(所有四个 NFR 的不可读性密度均下降(例如,NL 丰富的性能为 0.88 -> 0.69))并降低了对提示措辞的敏感度,但并不能可靠地提高功能正确性;对于错误处理,扩展测试通过率下降,表明防御性编码模式和精确输出基准之间存在紧张关系。第二个发现:当 ISO 内容保持不变时,NL-rich 和 Structured 在正确性上的差异可以忽略不计 (|delta| <= 0.023),这表明语义内容比 JSON-vs-prose 格式更重要。从业者应该投资基于标准的 NFR 内容,而不是序列化形式。提供完全可追溯的复制包。