论文
QuanBench+:基于 LLM 的量子代码生成的统一多框架基准
QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation
摘要
大语言模型 (LLM) 越来越多地用于代码生成,但量子代码生成仍然主要在单个框架内进行评估,这使得很难将量子推理与框架熟悉程度分开。我们推出了 QuanBench+,这是一个涵盖 Qiskit、PennyLane 和 Cirq 的统一基准测试,具有 42 个对齐的任务,涵盖量子算法、门分解和状态准备。我们通过可执行的功能测试来评估模型,报告 Pass@1 和 Pass@5,并使用基于 KL 散度的接受概率输出。我们还在基于反馈的修复后研究了 Pass@1,其中模型可能会在运行时错误或错误答案后修改代码。跨框架,最强的一次性得分在 Qiskit 中达到 59.5%,在 Cirq 中达到 54.8%,在 PennyLane 中达到 42.9%;通过基于反馈的修复,最佳分数分别上升至 83.3%、76.2% 和 66.7%。这些结果显示了明显的进展,但可靠的多框架量子代码生成仍未解决,并且仍然强烈依赖于特定于框架的知识。