论文

对现实世界存储库中人工智能生成的代码进行大规模综合测量

A Large-Scale Comprehensive Measurement of AI-Generated Code in Real-World Repositories

摘要

大语言模型 (LLM) 使开发人员能够生成从小片段到整个项目的代码,正在迅速改变软件工程。随着人工智能辅助代码越来越多地集成到现实世界的系统中,了解其特征和影响至关重要。现有的人工智能生成代码研究通常仅限于实验室环境,具有综合基准和小规模编码任务,并且涵盖的指标有限。人工智能辅助代码在现实世界代码库中的表现及其与人类编写的代码之间的差异仍不清楚。为了缩小这一差距,我们在现实世界的存储库中对人工智能辅助代码与人类编写的代码进行了首次大规模测量研究。我们研究了一套全面的指标,包括代码级方面(例如,结构和图形级复杂性、编码风格、安全质量等)和提交级特征(例如,提交大小、频率、提交后稳定性等)。我们的结果提供了新的发现和见解:一些对比了之前在实验室环境中的观察结果(例如,我们得出的结论是,现实世界中人工智能与人类在代码级指标上的差异相当小而不是更明显),一些结果通过更细粒度的观察扩展了先前的结果(例如,不同编程语言之间安全质量的差异),但更多的内容首次出现在以前未涵盖的方面(例如,代码重复率、提交大小和稳定性等)。基于这些全面的现实结果,我们还讨论了人工智能辅助编程的实际意义。