论文
LLM 可以解决科学问题还是只写代码?评估量子求解器的生成
Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation
摘要
大语言模型 (LLM) 在代码生成方面表现出强大的能力,推动了它们在自动化量子求解器开发中的使用。然而,在量子计算中,成功执行生成的代码还不够:正确性取决于数值精确的结果,这对非平凡映射、混合量子经典工作流程和特定于算法的近似很敏感。这项工作介绍了 Q-SAGE,这是一种迭代方法,用于评估 LLM 生成科学问题量子求解器的能力。该方法采用迭代方法,执行 LLM 生成的脚本,将结果与经典求解器的结果进行比较,并细化脚本,直到两个结果在容差阈值内匹配。我们通过五个不同复杂性的科学问题系列和五个 LLM(开源和专有)对该方法进行了实证评估。结果表明,迭代细化大大提高了成功率,但会带来显着的计算开销。此外,随着模型能力的增强,故障模式从执行错误转变为数值不准确,凸显了基于 LLM 的量子软件当前的局限性。