论文

使用 Bugs4Q 修复 Qiskit 程序对 大语言模型 进行基准测试

Benchmarking Large Language Models on Repairing Qiskit Programs using Bugs4Q

模型评测基准与评测资源

摘要

在量子程序中,Bugs4Q 是广泛使用的包含真实量子缺陷的基准。但是,其评估假设基准标签仍然有效并且生成的修复程序在目标环境中执行。我们评估了包含 67 个独特的真实 Qiskit 缺陷的两个 Bugs4Q 版本,添加了缺失的可执行测试,并重新运行了六个固定 Qiskit 版本(0.25.0、0.45.0、1.0.0、1.1.1、2.0.0 和 2.3.1)的所有条目。我们发现量子基准测试可能会遭受静默标签反转的影响:当参考修复停止执行或有缺陷的程序不再重现故障时,条目会毫无错误地变得无效。因此,正确性取决于(基准,版本)对,而不仅仅是基准。我们评估了四个 LLM(GPT-4o-mini、GPT-5o-mini、GPT-5.4 和 GPT-5.4-mini),为每个缺陷生成最多 10 个修复候选,并在所有版本中测试它们。 GPT-5.4 获得了最高的 pass@10 (48.8%),其次是 GPT-5.4-mini (47.3%)、GPT-5o-mini (30.3%) 和 GPT-4o-mini (22.6%)。所有模型在 Qiskit 0.45.0 上表现最佳,并在 Qiskit 1.0 过渡后下降。许多故障是由已弃用或不兼容的 API 引起的,而不是不正确的修复,并且 64\% 的成功修复发生在目标版本下无效的条目上。我们发布了重新验证的、版本固定的 Bugs4Q 基准测试,并表明基准测试验证必须先于修复评估。