论文
QBugLM:基于 LLM 的量子软件调试的代理基准测试框架
QBugLM: An Agentic Benchmarking Framework for LLM-based Quantum Software Debugging
摘要
量子软件错误通常会产生无声的、不正确的输出,而不是明显的错误,这使得它们特别难以用传统技术检测和修复。尽管 大语言模型 (LLM) 在经典软件工程任务上表现出了强大的性能,但它们调试量子代码的能力在很大程度上仍未得到探索。为了弥补这一差距,我们提出了 QBugLM,这是一个多代理框架,它可以自动化量子软件调试管道,从分类驱动的错误注入到基于 LLM 的检测和修复,最后到基于模拟的验证,适用于与框架无关的 OpenQASM 3.0 程序。我们进一步使用 QBugLM 对两个 LLM、Claude 4.6 Sonnet 和 Qwen3 Coder Next 进行基准测试,涵盖不同的提示策略、错误类别和量子程序。我们的结果表明,迭代反馈至关重要,因为单次重试即可将 Pass@1 从低于 25% 提高到高于 80%。此外,对于固定资源约束下的推理能力模型,更简单的结构化提示甚至可以优于 Chain-of-Thought 和 ReAct。我们的工作朝着对 LLM 调试量子程序的能力进行基准测试迈出了第一步,并提供了实用的见解来支持自动化量子软件修复的未来工作。