论文
PAIChecker:发现并检查类似 SWE 基准的 PR 问题不一致
PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks
摘要
类似 SWE 基准的基准测试广泛用于评估 LLM 的问题解决能力。它们通常遵循通用的构建流程:通过从 PR 描述中提取问题引用,将每个 PR(拉取请求)与其链接的问题配对;问题描述作为问题陈述,PR 补丁作为测试预言机。然而,由于开发和维护大型存储库固有的复杂性,这种 PR 与问题的配对在实践中经常不一致。在这项工作中,我们系统地研究了 SWE-bench Verified 实例,发现 13.6% 的实例在 11 种细粒度场景中的 5 种模式中表现出错位。为了在未来实现这些基准的可靠且可扩展的构建,我们提出了 PAIChecker,这是一个多代理系统,用于检查类似 SWE 基准的基准中 PR 问题的错位。具体来说,PAIChecker采用三阶段设计,结合特定模式识别、跨智能体标签合成和代码级验证,从而实现更准确、可泛化和逐步验证的检测。在 SWE-Gym 和 SWE-bench Multilingual 上的实验表明,PAIchecker 在所有四个 LLM 主干上实现了最佳性能,分别达到了 92.12% 和 91.67% 的二进制准确率。