论文

跨连续 SDK 版本对 LLM 生成的量子代码中的 API 漂移进行基准测试

Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

模型评测基准与评测资源

摘要

大语言模型 可以生成合理的量子代码,但尚不清楚它们是否能够可靠地针对用户请求的特定软件开发工具包 (SDK) 版本。我们将这个问题作为 API 漂移来研究,并引入了Quantum-API-drift,这是一个衡量版本保真度的基准,这里定义为在 LLM 生成的量子 SDK 代码中所请求的 SDK 版本的执行成功、跨版本兼容性、故障模式和文档引导的修复。我们使用 Qiskit 实例化基准测试,Qiskit 是一个具有代表性的量子 SDK,在 v0.43、v1.3 和 v2.0 中经历了重大的接口更改。我们评估了 50 项任务的 17 个模型,每个提示有 3 个样本,生成了 450 个样本,每个模型执行了 1,350 次。在具有 1024 个词元输出上限的匹配 REST API 设置中测试了 16 个模型,而 GPT-5.4 (Codex CLI) 则单独报告为参考配置。在 16 个匹配的 REST 模型中,对角线 Pass@1 的范围从 0.02 到 0.85。 Claude Opus 4.7 在 v0.43 和 v2.0 上最强,而 Grok 4.20 在 v1.3 上最强,为 0.513。错误概况因模型强度而异:较弱的模型主要因导入损坏而失败,而较强的模型通常会达到弃用级别的失败。文档引导的修复总体上有 0.19 到 0.59 次修复尝试成功,并且对于迁移到 v2.0 始终比迁移到 v1.3 更有效。基准测试工件可在 https://github.com/arasyi/quantum-api-drift 上公开获取。这些结果表明,版本对齐是量子代码生成的一个独特的评估轴,并且即使有迁移指导,API 漂移也只能部分恢复。