论文

PennySynth:RAG 驱动的数据合成,用于自动生成量子代码

PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation

上下文与知识检索增强

摘要

量子编程框架日益复杂,暴露了现有基于 大语言模型 (LLM) 的代码助手的一个关键限制:通用模型会幻觉 PennyLane 特定的门名称、放错设备配置,并在面临专门的量子编码挑战时产生结构上无效的电路。我们提出了 PennySynth,一个检索增强的生成框架,它通过在 13,389 个 PennyLane 指令代码对的策划知识库上调节 LLM 推理来解决这一差距,该知识库是通过官方 PennyLane 存储库、社区 GitHub 源和 QHack 竞赛档案的三阶段提取、验证和重复数据删除管道构建的。 PennySynth 引入了使用 st-codesearch-distilroberta-base 的代码感知嵌入策略,该策略经过训练用于自然语言到代码检索,与通用基线相比,平均检索余弦相似度从 0.45 增加到 0.726。在 QHack 竞赛三年(2022 年、2023 年、2024 年)的 74 个挑战中进行评估,PennySynth 在 QHack 2022、2023 和 2024 上分别实现了 64%、68% 和 52% 的 pass@5 率,比没有检索的 Claude Sonnet 4.6 提高了 +28、+25 和 +28 个百分点。我们进一步引入了一种量子适应的 CodeBLEU 度量,该度量增加了 qml.* 词元模式的权重,并表明结构代码相似性和功能正确性捕获了量子代码质量的不同方面。受控消融表明,代码感知嵌入是检索性能的主要驱动因素,而当检索质量足够精确时,数据集扩展和源组合可提供额外的收益。