论文

QASM-Eval:用于在量子电路之外的 OpenQASM-3 上训练和评估 LLM 的数据集

QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

模型评测基准与评测资源

摘要

量子计算仍处于噪声中尺度量子(NISQ)时代,性能受到噪声的限制。解决这一限制需要门序列之外的面向硬件的功能:用于量子纠错(QEC)的中电路测量和经典反馈、动态去耦(DD)的精确定时以及用于校准的脉冲级波形访问。 OpenQASM 3 通过硬件级编程接口公开这些功能。尽管 大语言模型 (LLM) 在代码生成方面取得了快速进展,但针对这些高级功能的数据集仍然缺乏。我们推出了 QASM-Eval,这是第一个在 OpenQASM 3 上训练和评估 LLM 的综合数据集,目标是在提供的程序上下文中完成面向硬件的构造。 QASM-Eval 包含专家策划的包含 1,200 个任务的测试集和包含 4,000 多个任务的训练集,涵盖经典逻辑、定时调度、脉冲控制以及受量子控制工作流程启发的复杂任务。扩展验证器自动检查语法、量子测量分布和程序时间线。我们的评估确定了 OpenQASM 3 代码生成的巨大空间以及目标 微调 的显着收益。经过微调的 Llama-3-8B 优于零镜头 GPT-5.6-Terra,而经过微调的 Llama-3-70B 实现了 61.17% 的整体 pass@1 并接近少数镜头增强的 GPT-5.6-Terra。 QASM-Eval 为通过 OpenQASM 3 面向硬件的构造生成规范引导的代码提供了基准和训练资源,支持用于量子编程的 LLM 助手的开发。数据和代码:https://github.com/fuzhenxiao/QASM-Eval