GitHub Pull 请求的 AI 到 AI 代码审查
AI-to-AI Code Reviews of GitHub Pull Requests
摘要
AI 编码智能体 越来越多地集成到软件开发工作流程中,在拉取请求 (PR) 流程的两侧运行:AI 创作代理创建或修改 PR,而 AI 审阅者则对其进行评估。这创建了一个闭环,其中一个人工智能 编码智能体 审查另一个人工智能的贡献。我们通过将 AI 属性的 PR 与来自 CodAGE(编码代理生成的 GitHub 事件的公共数据集)的 AI 属性审核事件联系起来,构建了一个大规模的 AI 到 AI 代码审核数据集。我们的数据集包含 248,641 个独特的 AI 属性 PR,这些 PR 至少收到了一篇 AI 属性评论。其中,45,269 件接受了跨产品审查,208,145 件接受了同产品审查; 4,773 名 PR 获得了这两项奖励。在已确定的代理撰写的 PR 中,跨产品 AI 到 AI 审核的比例约为 1.6%,但从绝对值来看,其数量相当可观,并且其数量从 2025 年第一季度到 2025 年第三季度增加了两个以上数量级。审稿人的输出因作者-审稿人配置而异。 CodeRabbit 将 Claude Code 撰写的 PR 上的评论中的 35.0% 标记为重构评论,而 Copilot 撰写的 PR 上的这一比例为 10.5%,尽管这种差异可能反映了 PR 的特征而不是审阅者的特征。对于四名双角色审稿人中的三名来说,同一产品组中每个 PR 的平均评论要高出 58-65%,尽管效果大小很小或可以忽略不计,并且差异集中在上尾部。在具有完整非负时间戳的对中,观察到的跨产品对的中位延迟为 1.2 分钟,相同产品对的中位延迟为 4.7 分钟;不同的时间戳可用性和审阅者组成限制了这种比较。总体而言,闭环人工智能对人工智能的审查正在增加,但仍然只占已识别的代理活动的少数,审查输出因创作代理组和产品配置而异。