论文

有效的代码,无效的环境:测量人工智能生成的软件中的环境再现性

Code That Works, Environments That Don't: Measuring Environment Reproducibility in AI-Generated Software

智能体系统Agent任务评测

摘要

代码生成已成为大语言模型的核心功能,编码Agent现在能够根据自然语言提示生成功能正确的软件项目。然而,功能正确性本身并不能捕获生成质量的关键维度:环境规范(定义为执行生成代码所需的依赖关系的准确识别)同样重要。我们开发了一个用于环境规范的Agent协议,并引入了一个三层框架,包括声明的、运行时安装的以及必要和充分的依赖项,以系统地评估环境规范的编码Agent。使用该协议,我们评估编码Agent系统地错误指定软件环境依赖性的程度,以及这种错误指定在三个Agent、四种语言和五十个编程任务中如何变化。我们的结果表明,当前的编码Agent在这个维度上表现出系统的泛化失败,产生了功能测试无法检测到的不一致、冗余或不完整的依赖规范。在Agent之间,对于相同的任务,依赖集一致性低至 7%,并且较新的Agent没有显示出有意义的改进,这表明故障并未通过规模或新近度来解决。最大的差异发生在声明的依赖层和运行时依赖层之间,这意味着从模型的训练分布中学习到的环境先验是主要驱动因素。我们的研究结果将环境规范建立为当前基准无法捕获的独特的、可测量的代码生成质量轴,并激发了联合优化功能正确性和环境可移植性的训练目标和评估协议。