论文

大语言模型及其对力学与空间几何的认知

Large Language Models and their Awareness of Mechanics and Spatial Geometry

模型评测基准与评测资源

摘要

大语言模型(LLM)在成熟的代码生成与数学推理基准上表现良好,但其在力学与空间几何上的能力——本文称之为机械工程认知——尚未被系统量化。我们提出MecEng,一个全自动化基准,评估LLM根据参数化文本描述创建多体仿真模型的能力。该基准包含三个难度级别共84个通用任务,从带关节与接触的刚体系统,到需要精确3D几何生成、四面体有限元网格划分以及机械零件Hurty-Craig-Bampton模型降阶的柔性多体系统。一条由LLM驱动的专用流水线使用Netgen从文本生成可直接仿真的几何,并为代码Exudyn构建多体系统模型,随后在多个层级上与专家真值核对:包括带图节点标注的系统图同构、数值解,以及质量、几何与特征频率等零件级指标。共评估了32个开源权重模型与2个专有模型。在刚体任务上,最佳开源模型总体成功率为86.0%,最强专有模型为91.4%,而柔性多体任务仍明显更难。附加研究量化了采样温度、推理、提示设计、模型规模与模型发布时间的影响。结果表明,当前LLM的机械工程认知在快速进步,但仍易出错。

大语言模型及其对力学与空间几何的认知:论文配图
(a) level 1 任务 (b) level 2 任务 (c) level 3a 任务 (d) level 3b 任务 图1:本工作所研究的四种任务类型的求解示例。全部四个示例均由开源权重 LLM gemma4:31b 完全生成。尺寸与可视化设置随后被手动调整,以便在图中更清晰可见。