您的仿真运行但解决了错误的物理场:对 LLM 生成的多物理场仿真代码进行基于偏微分方程的意图验证
Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code
摘要
对 LLM 生成的代码进行基于执行的评估隐式地将成功执行视为正确性的代理。在科学模拟中,这种代理是不够的:生成的输入文件可以运行、网格划分和收敛,同时对与用户意图不同的控制方程进行编码。我们将预期物理和生成代码之间的这种不匹配称为理解-生成差距。我们在 MOOSE 中实例化这一点,其中内核和 BC 对象组合地映射到弱形式残差项,从而实现编码 PDE 的确定性重建并与预期合约进行比较。我们将这种比较形式化为意图保真度得分 (IFS),这是一种涵盖管理术语、BC、IC、系数和时间方案的结构性指标。在 IFS 的基础上,我们开发了一个基于 PDE 的细化循环,该循环使用确定性违规报告来迭代地纠正生成的代码。我们在 MooseBench 上进行评估,这是一个 220 例多物理场基准测试,具有 PDE 级 真值,与这项工作一起发布。在此基准测试中,与直接生成相比,我们的方法持续改进了平均 IFS,增益集中在困难情况下。在直接生成低于 IFS 0.7 的子集上,细化增加了 +0.22 至 +0.41 绝对 IFS。在部署审计中,仅执行修复提高了执行成功率,同时使所有 220 个案例中的 39-40% 保持可运行,但仍然解决了三个主要部署审计模型中的错误物理问题,将可执行性和意图保真度暴露为可分离的故障模式。对四种面向 PDE 的 DSL(UFL/FEniCS、FreeFEM、FiPy 和 Devito)进行的静态概念验证实验表明,重建和比较模式超出了 MOOSE 的范围。这些发现强调,可执行的模拟代码应该根据其打算编码的数学结构进行验证,而不是仅在执行时接受。