论文

谁来完成工作? AI 编码代理拉取请求的后续修复和提交作者身份研究

Who Finishes the Job? A Study of Follow-Up Fixes and Commit Authorship on AI Coding Agent Pull Requests

智能体系统Agent任务评测

摘要

AI 编码代理现在创作了大量合并到流行开源项目中的拉取请求 (PR)。合并后的代理 PR 通常被视为已完成的工作;然而,之前的研究报告了合并后代理代码中的问题(例如,代码异味和静态分析问题)。然而,对于合并后的代理 PR 修复的频率以及修复的实际作者却知之甚少。在本文中,我们跟踪来自 AIDev-pop 数据集(至少有 500 颗星的开源存储库)的 5 个 AI 编码代理(OpenAI Codex、GitHub Copilot、Devin、Cursor 和 Claude Code)中的 6,774 个合并代理 PR 到它们的后续修复中,以来自同一存储库的 5,044 个同期人类 PR 为基准。我们将每个合并与其候选修复链接起来,使用人类注释者和符合人类级别协议的大语言模型法官验证每个候选(二进制 Cohen 的 Kappa=0.78 与人类 K=0.77,直接修复精度 90%),并将修复工作归因于 PR 和提交级别。我们的研究结果表明,(1) 合并的代理 PR 吸引经过验证的修复的几率是同一存储库中同一时间段内合并的人类 PR 的 1.62 倍; (2) 代理合并中 69.6% 的已验证修复来自同一代理; (3) 76.4% 的已验证修复 PR 在所有提交中都是由代理编写的。这些结果表明,代理目前基本上完成了自己的工作,但他们的合并仍然需要比人工合并更频繁地修复。