论文

QuSema:用量子知识增强Agent发现软件静默错误

QuSema: Detecting Silent Bugs in Quantum Libraries via Quantum-knowledge-enhanced Agents

应用与实践智能体系统Agent 工具调用Agent Harness编程

摘要

量子库现在是量子算法开发的关键基础设施,但其正确性仍然难以测试。现有的测试技术主要依赖于基于失败或基于比较的预言机,仅在执行失败、违反运行时检查或与其他实现不一致时才会暴露错误。当合适的基于执行的预言机不可用时,它们的适用性受到限制,从而导致一些静默的错误未被检测到。此类遗漏的错误可能会产生不正确的结果,并传播到实验结论、模拟研究和算法设计中。在这里,我们介绍 QuSema,一种用于在量子库中查找无声错误的自主测试Agent。 QuSema 使用量子语义和文档的约束作为源级语义预言机来评估实现逻辑是否可以从有效输入产生无效输出。它通过 Agentic 循环进行操作,该循环反复检查库 API 文档和源代码、量子操作预期行为的原因、识别潜在的语义偏差并验证 通过库 API 生成可执行测试。在量子域推理的指导下,QuSema 将高级行为不匹配转化为具体的、用户可触发的错误报告,使其能够发现非崩溃缺陷。我们为 Qiskit 和 PennyLane 实施 QuSema。在 20 个历史无声错误的基准测试中,QuSema 实现了比 Claude Code 和 Codex 更高的平均错误重定位计数,而 DeepSeek 配置的成本低于 Claude Code。 QuSema 还发现了 40 个经开发人员确认的先前未知的错误,其中包括 30 个静默错误。

QuSema:用量子知识增强Agent发现软件静默错误:论文原图
图 1. 使用黑盒测试预言机的方法的局限性。 (a) 执行结果之间的预期关系的可用性有限,其中等效电路可以具有不同的资源计数,并且一些更高级别的资源估计功能缺乏跨库对应项。 (b) 低效触发,实现 CU 门时的错误仅在特定语义条件下才会暴露。