论文

从行业主张到实证现实:拉取请求中代码审查代理的实证研究

From Industry Claims to Empirical Reality: An Empirical Study of Code Review Agents in Pull Requests

摘要

自治 编码智能体 正在以前所未有的规模生成代码,仅 OpenAI Codex 在两个月内就创建了超过 400,000 个拉取请求 (PR)。随着代理 PR 数量的增加,代码审查代理 (CRA) 已成为开发工作流程中的常规看门人。行业报告称,CRA 无需人工参与即可管理开源存储库中 80% 的 PR。因此,了解 CRA 审查的有效性对于维护开发工作流程和防止在废弃的拉取请求上浪费精力至关重要。然而,关于 CRA 反馈质量如何影响 PR 结果的经验证据仍然有限。本文的目的是通过实证分析审稿人构成和 CRA 生成评论的信号质量,帮助研究人员和从业者了解 CRA 何时以及如何影响 PR 合并成功。从 AIDev 的 19,450 个 PR 中,我们分析了处于评论状态的 3,109 个独特 PR,比较了纯人类评论与纯 CRA 评论。我们检查了 98 个仅 CRA 已关闭的 PR,以评估低信噪比是否会导致放弃。仅 CRA 的 PR 实现了 45.20% 的合并率,比仅人类的 PR (68.37%) 低 23.17 个百分点,放弃率明显更高。我们的信噪比分析显示,60.2% 的封闭式 CRA PR 落入 0-30% 的信号范围,13 个 CRA 中有 12 个的平均信号比低于 60%,这表明自动审核反馈中存在大量噪音。这些发现表明,没有人工监督的 CRA 通常会产生与更高的放弃率相关的低信号反馈。对于从业者来说,我们的结果表明 CRA 应该增强而不是取代人工审核员,并且人工参与对于有效且可操作的代码审核仍然至关重要。