论文

为什么代理拉取请求会被合并或拒绝?实证研究

Why Are Agentic Pull Requests Merged or Rejected? An Empirical Study

模型评测评测方法与指标

摘要

AI 编码智能体 越来越多地向开源存储库提交拉取请求(Agentic-PR),但它们的性能通常仅使用合并和拒绝结果来评估。我们假设,在不考虑评论交互的情况下,这些结果标签不能可靠地反映代理的能力。为了测试这一点,我们对 11,048 个已关闭的 Agentic Pull 请求进行了面向决策的分析,细化为 9,799 个经过人工审核的 PR,并手动检查了 717 个代表性案例,以从交互工件中恢复决策原理。我们发现拒绝结果大大夸大了代理错误:只有 35.7% 的被拒绝 PR 反映了明显的代理失败,而 31.2% 是由工作流程限制驱动的,33.1% 缺乏可观察的决策理由。在合并的 PR 中,15.4% 需要通过反馈或直接提交明确审阅者参与,5.5% 没有显示可见的交互痕迹。我们进一步观察了代理之间的系统差异,Copilot 和 Devin 更经常嵌入审稿人介导的工作流程中,而 Codex 和 Cursor PR 通常以最少的交互进行合并。这些结果拒绝了公关结果仅反映代理绩效的假设,并证明需要基于评论行为的交互感知评估。