论文

EngiAI:用于大语言模型驱动的工程设计的多智能体框架和基准套件

EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design

智能体系统Agent任务评测长程任务评测

摘要

大语言模型(LLM)代理越来越多地应用于工程设计任务,但现有的评估框架并不能充分解决结合模拟、检索和制造准备的多代理系统。我们引入了具有三个评估维度的基准套件:(1)具有七种提示样式的工作流程基准,针对不同的认知需求,包括直接工具使用、语义消歧、条件分支和工作记忆任务; (2) 检索增强生成 (RAG) 基准,具有门控评分,隔离检索对参数选择的贡献; (3) 高性能计算 (HPC) 基准评估 SLURM 集群上的端到端 ML 训练编排。除了基准测试之外,我们还展示了 EngiAI,这是一个基于 LangGraph 构建的多代理系统 (MAS) 参考实现,它通过监管架构协调七个专门代理、统一拓扑优化、文档检索、HPC 作业编排和 3D 打印机控制来操作基准。在四个 LLM 后端和两个 EngiBench 问题中,专有模型在 Beams2D 上实现了 96-97% 的平均任务完成率,而开源 4B 参数模型达到 55-78%,具有明显的代际改进。条件分支被证明是最具挑战性的,在 Photonics2D 上条件样式的任务完成率下降到 20-53%。 RAG 门控确认了近乎完美的检索增强分数($\约 1.0$),而没有检索则接近于零,从而验证了评估设计。在 HPC 编排中,一个模型在 100% 的运行中完成了所有管道步骤,而另一个模型则下降到 50%,这表明多步骤指令在长时间运行的工作流程中会降低。

EngiAI:用于大语言模型驱动的工程设计的多智能体框架和基准套件
图 2:同一问题实例(Beams2D、种子 3、示例 3)上 W-Cond 样式的设计比较。每组显示不同的 LLM 后端:代理生成的设计(左)、地面实况(中)和像素绝对差(右)。 Gemini-3-Flash 选择正确的条件分支并通过任务完成(TC = 1.0,IoU = 0.58); Qwen3-4B 未通过参数验证(TC = 0.0,IoU = 0.37),产生具有较大误差区域的明显不同的拓扑。