论文
大语言模型及其对力学与空间几何的认知
Large Language Models and their Awareness of Mechanics and Spatial Geometry
摘要
大语言模型(LLM)在成熟的代码生成与数学推理基准上表现良好,但其在力学与空间几何上的能力——本文称之为机械工程认知——尚未被系统量化。我们提出MecEng,一个全自动化基准,评估LLM根据参数化文本描述创建多体仿真模型的能力。该基准包含三个难度级别共84个通用任务,从带关节与接触的刚体系统,到需要精确3D几何生成、四面体有限元网格划分以及机械零件Hurty-Craig-Bampton模型降阶的柔性多体系统。一条由LLM驱动的专用流水线使用Netgen从文本生成可直接仿真的几何,并为代码Exudyn构建多体系统模型,随后在多个层级上与专家真值核对:包括带图节点标注的系统图同构、数值解,以及质量、几何与特征频率等零件级指标。共评估了32个开源权重模型与2个专有模型。在刚体任务上,最佳开源模型总体成功率为86.0%,最强专有模型为91.4%,而柔性多体任务仍明显更难。附加研究量化了采样温度、推理、提示设计、模型规模与模型发布时间的影响。结果表明,当前LLM的机械工程认知在快速进步,但仍易出错。
