论文
并非所有代理都是平等的:五个自主编码代理的代码质量和合并后维护
Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents in the Wild
摘要
自主编码代理现在在公共存储库中打开拉取请求,其规模是两年前无法达到的,但人们对代码落地后会发生什么知之甚少。本文研究了来自 5 个商业代理(OpenAI Codex、Devin、GitHub Copilot、Cursor 和 Claude Code)的 37,623 个带有出处标记的拉取请求 (PR) 以及匹配的人类基线,这些基线取自 2024 年 12 月至 2025 年 7 月期间从 2,807 个 GitHub 存储库中提取的数据。我们将 AIDev 数据集与 58,792 个缓存的 GitHub API 响应相结合,以测量添加的代码、结构中的安全气味。可维护性、合并后流失、恢复率和人工审核行为。三个结果脱颖而出。首先,质量差异是供应商特定的而不是统一的:Codex 编写的 PR 的恢复频率约为人类 PR 的一半(6.1% vs. 11.5%,比值比 0.50),而 Devin PR 的恢复频率更高(14.5%,比值比 1.31)。其次,由于硬编码凭证和评估式构造较少,跨供应商汇集的代理代码比人类代码更不可能包含安全气味(比值比 0.63)。第三,审核工作的集中度不均匀:Copilot PR 提出了最多的人工审核和变更请求,而 Claude Code PR 等待第一次人工审核的时间最长(中位时间为 12.6 小时)。所有管道代码、统计报告和数据均已发布以供复制。