论文
大语言模型能求解工程方程吗?直接预测与求解器辅助方法的系统比较
Can Large Language Models Solve Engineering Equations? A Systematic Comparison of Direct Prediction and Solver-Assisted Approaches
摘要
需要迭代数值求解的超越方程遍及工程实践,从流体力学摩擦系数计算到轨道位置确定。我们系统评估大型语言模型能否通过直接数值预测求解这些方程,还是将 LLM 符号操作与经典迭代求解器结合的混合架构更为有效。我们在覆盖七个工程领域的 100 个问题上测试六个最先进模型(GPT-5.1、GPT-5.2、Gemini-3-Flash、Gemini-2.5-Lite、Claude-Sonnet-4.5、Claude-Opus-4.5),比较直接预测与求解器辅助计算,后者由 LLM 构造控制方程并提供初始条件,由 Newton-Raphson 迭代执行数值求解。直接预测在各模型上产生 0.765 至 1.262 的平均相对误差,而求解器辅助计算达到 0.225 至 0.301,相当于误差降低 67.9% 至 81.8%。领域特定分析显示,电子学领域因指数方程的敏感性而改进显著(93.1%),与之相对,流体力学领域收益有限(7.2%),LLM 在该领域表现出有效的模式识别。这些发现表明,当代 LLM 擅长符号操作与领域知识检索,但在精度关键的迭代算术上表现吃力,提示其最佳部署方式是作为经典数值求解器的智能接口,而非独立的计算引擎。
