论文
RepoProbe:使用清单对架构感知存储库理解进行基准测试
RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists
摘要
大语言模型 (LLM) 与软件工程的集成已将重点从功能级生成转移到存储库规模的帮助。然而,现有的基准测试很大程度上依赖于 GitHub Issues 的错误报告,这通常允许模型通过错误日志上的模式匹配来绕过真正的理解。这种不一致程度低于编辑偏差,它指的是过早生成,其中模型过早地提出代码修改而不是理解现有的存储库架构。此外,当前的 LLM-as-a-Judge 标量评分存在高方差和低可解释性。这项工作引入了 RepoProbe,这是一种新颖的基准,用于使用 GitHub 讨论通过开放式问答来评估存储库级代码理解,该基准侧重于开放式架构查询而不是缺陷报告。为了确保严格的评估,我们提出了一种基于清单的验证协议,将答案分解为原子的、可验证的事实,从而用客观验证取代主观评分。我们对最先进 (SOTA) LLM 的评估揭示了高清晰度和有根据的技术正确性之间持续存在的差距。它还定量地证实了编辑偏差的普遍存在,其中模型优先考虑代码生成而不是架构分析。最后,我们证明,与传统的标量评分评估相比,我们的验证协议显着提高了评估可靠性。