论文

HEJ-Robust:基于 LLM 的自动化程序修复的鲁棒性基准

HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair

模型评测基准与评测资源

摘要

最近的 大语言模型 (LLM) 在跨标准基准的自动程序修复方面表现出了强大的性能。然而,这些基准测试基于单一规范形式的错误代码来评估模型,并不能反映现实世界软件中常见的语法变化,从而导致鲁棒性在很大程度上未经检验。在这项工作中,我们构建了 HEJ-Robust,这是一个从 HumanEval-Java-Bug 构建的鲁棒性基准,使用八种保留语义的代码转换,产生了 1,450 个转换后的实例。我们在此基准上评估了五个经过微调的 LLM,结果表明,在多次转换下,模型性能下降了 50% 以上,这表明当前基于 LLM 的修复模型缺乏对微小语法变化的鲁棒性。