论文
更安全的构建者,危险的维护者:人类与代理 PR 的重大变化的比较研究
Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs
摘要
AI 编码智能体 越来越多地集成到现代软件工程工作流程中,积极与人类开发人员合作,在开源存储库中创建拉取请求 (PR)。尽管 编码智能体 提高了开发人员的工作效率,但它们生成的代码通常比人类编写的代码具有更多错误和安全问题。虽然人类编写的 PR 经常破坏向后兼容性,从而导致重大更改,但代理 PR 引入重大更改的潜力仍未得到充分探索。本文的目标是通过检查人工智能代理引入重大变化的频率和任务上下文,帮助开发人员和研究人员评估人工智能生成的 PR 的可靠性。我们对 AIDev 数据集中的 Python 存储库中的 7,191 个代理生成的 PR 与 1402 个人类创作的 PR 进行了比较分析。我们开发了一种工具,可以分析与代理 PR 相对应的提交中的代码更改,并利用基于抽象语法树 (AST) 的分析来检测潜在的重大更改。我们的研究结果表明,在代码生成任务中,人工智能代理总体上比人类引入的重大更改要少(3.45% vs. 7.40%)。然而,代理在维护任务期间表现出更高的风险,重构和杂务更改分别以 6.72% 和 9.35% 的比率引入破坏性更改。我们还发现了一个“信心陷阱”,其中高度自信的代理 PR 仍然会引入重大变更,这表明无论报告的信心分数如何,在面向维护的变更期间都需要进行更严格的审查。