论文

SWE-PRBench:根据 Pull 请求反馈对 AI 代码审查质量进行基准测试

SWE-PRBench: Benchmarking AI Code Review Quality Against Pull Request Feedback

模型评测应用与实践基准与评测资源编程

摘要

我们引入了 SWE-PRBench,这是一个包含 350 个拉取请求的基准,带有人工注释的 真值,用于评估 AI 代码审查质量。根据 kappa=0.75 验证的 LLM-as-judge 框架进行评估,8 个前沿模型在仅 diff 配置上仅检测到 15-31% 的人为标记问题,这表明,尽管代码生成基准测试结果强劲,但 AI 代码审查仍然远低于人类专家的表现。 Pull 请求从活跃的开源存储库中提取,使用存储库质量分数从 700 个候选者中筛选出来,并在三种冻结上下文配置下进行评估:仅 diff (config_A)、diff 与文件内容 (config_B) 和完整上下文 (config_C),从而实现上下文提供策略的系统化消融。所有 8 个模型都会从 config_A 单调降级到 config_C,即使上下文是通过结构化语义层(包括 AST 提取的函数上下文和导入图解析)提供的。主要机制是 config_B 上 Type2_Contextual 问题检测的崩溃,与长上下文中的注意力稀释一致:结构化的 2,000 个词元的 diff-with-summary 提示优于包含所有 8 个模型的执行上下文、行为映射和测试签名的 2,500 个词元的完整上下文提示。前四个模型在统计上无法区分(平均得分 0.147-0.153),而它们与其余四个模型之间存在明显的等级差距(平均得分 <= 0.113)。数据集、上下文、注释和评估工具均公开发布。