论文

代理人工智能生成程序的可靠性研究

A Study of the Reliability of Agentic AI-Generated Programs

模型评测鲁棒性、公平性与可信度评测

摘要

基于 Agentic-AI 的软件开发有望更快地完成软件、提高程序员效率和更可靠的代码。问题是如何客观地验证这些说法?在这个项目中,我们试图通过三种实践来回答这个问题。首先,我们应用了典型的最佳实践代理人工智能工作流程进行软件开发。其次,我们的目标程序是十个众所周知的、具有发布质量的人工编写的 Linux 实用程序,以便我们可以将人工智能生成的代码与具体的事实进行比较。第三,我们的可靠性衡量基于广泛使用的测试技术,即模糊随机测试。对于此测试,我们使用了经典的黑盒、分代测试和使用 AFL++ 的更现代的覆盖引导(灰盒、突变)测试。我们发现,人工智能生成的实用程序版本通常与这些程序的最新人类生成版本一样可靠,而且往往更可靠。虽然人工智能生成的版本确实存在一些故障,但它们比标准存储库中的代码要少见。有趣的是,人工智能生成的代码不太可能出现内存错误(例如缓冲区溢出)等故障,但更有可能出现无限循环等挂起。此外,我们还验证了使用代理人工智能生成强大且可靠的软件需要仔细的实践和人工监督。代码的质量很大程度上取决于所使用的提示和技能,以及指导流程的人员如何响应。我们还证明,使用代理人工智能工作流程进行软件开发(及其提示和技能)可以成为代码规范,从而实现软件的经济高效的可持续性。