论文
评估 大语言模型 稳定科学软件中的数值表达式
Assessing Large Language Models for Stabilizing Numerical Expressions in Scientific Software
摘要
科学软件依赖于高精度计算,但有限浮点表示会引入在安全关键领域中传播的精度误差。尽管 大语言模型 (LLM) 在科学应用中的使用越来越多,但它们在处理浮点数值稳定性方面的可靠性尚未得到系统评估。本文通过两个任务评估 LLM 的推理:(1)通过生成引发错误的输入来检测数值表达式的不稳定性(检测),以及(2)重写表达式以提高数值稳定性(稳定)。基于流行的数值基准,我们在 2,037 个数值结构上评估了 4 个最先进的 LLM,包括嵌套条件、高精度文字和多变量算术,涉及 469,000 个任务。我们的结果表明,LLM 在检测和稳定数值不稳定计算方面补充了传统方法。值得注意的是,LLM 在基线方法失败的地方精确地优于基线方法,稳定了基线无法改进的 61.2% 的表达式。然而,更广泛地说,传统基线优于 LLM:Herbie 稳定了 93.7% 的表达,而 LLM 稳定了 67.2%,并且在稳定的表达上,Herbie 在 42.7% 的情况下实现了更高的准确性。 LLM 与控制流和高精度文字作斗争,始终删除此类结构而不是推理其数字含义,同时在纯符号表达式上表现得更好。即使 LLM 保留结构,它们的数字推理也会动摇,在超过 46% 的情况下产生语义上不等价的表达式。这些发现表明,LLM 可以有效地稳定经典技术无法做到的表达,但在高精度量值和控制流语义需要精确推理时会遇到困难,因为在训练过程中很少看到这种具体模式。