论文

PDEAgent-Bench:面向偏微分方程求解器生成的多指标、多库基准

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

模型评测基准与评测资源

摘要

PDE到求解器的代码生成旨在从偏微分方程(PDE)描述中自动合成可执行的数值求解器。这一任务不仅要求理解PDE的数学结构,还要求选择合适的离散化方案与求解器配置,并在有限元方法(FEM)库中正确实现所得到的公式。现有代码生成基准主要评估语法正确性,或在预定义测试用例上的成功率。据我们所知,目前尚无专门面向PDE到求解器代码生成的公开可用基准,而通用代码基准也无法完全捕捉数值求解PDE所特有的挑战,例如保证求解器的精度、效率以及与专业FEM库的兼容性。我们提出PDEAgent-Bench,据我们所知,这是首个面向PDE到求解器代码生成的多指标、多库基准。PDEAgent-Bench包含645个实例,横跨6个数学类别和11个PDE族,并支持DOLFINx、Firedrake和deal.II等常用FEM库。每个实例提供面向智能体的问题描述、在规定评估网格上的参考解,以及针对具体案例的精度和运行时间目标。PDEAgent-Bench采用分阶段评估框架,生成的求解器必须依次通过可执行性、数值精度和计算效率检查。在代表性大语言模型(LLM)和代码智能体上的实验表明,模型通常能生成可运行的代码,但一旦强制执行精度和效率要求,其通过率会大幅下降。这些结果表明,当前智能体在生成数值上可靠且高效的PDE求解器方面仍能力有限,而PDEAgent-Bench提供了一个立足于数值PDE求解实际需求的可复现测试平台。

PDEAgent-Bench:面向偏微分方程求解器生成的多指标、多库基准:论文配图
图1:PDEAgent-Bench总览:通用代码基准的局限、多库多指标基准的数据结构与评测协议。