论文
EngiAI:用于大语言模型驱动的工程设计的多智能体框架和基准套件
EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
摘要
大语言模型(LLM)代理越来越多地应用于工程设计任务,但现有的评估框架并不能充分解决结合模拟、检索和制造准备的多代理系统。我们引入了具有三个评估维度的基准套件:(1)具有七种提示样式的工作流程基准,针对不同的认知需求,包括直接工具使用、语义消歧、条件分支和工作记忆任务; (2) 检索增强生成 (RAG) 基准,具有门控评分,隔离检索对参数选择的贡献; (3) 高性能计算 (HPC) 基准评估 SLURM 集群上的端到端 ML 训练编排。除了基准测试之外,我们还展示了 EngiAI,这是一个基于 LangGraph 构建的多代理系统 (MAS) 参考实现,它通过监管架构协调七个专门代理、统一拓扑优化、文档检索、HPC 作业编排和 3D 打印机控制来操作基准。在四个 LLM 后端和两个 EngiBench 问题中,专有模型在 Beams2D 上实现了 96-97% 的平均任务完成率,而开源 4B 参数模型达到 55-78%,具有明显的代际改进。条件分支被证明是最具挑战性的,在 Photonics2D 上条件样式的任务完成率下降到 20-53%。 RAG 门控确认了近乎完美的检索增强分数($\约 1.0$),而没有检索则接近于零,从而验证了评估设计。在 HPC 编排中,一个模型在 100% 的运行中完成了所有管道步骤,而另一个模型则下降到 50%,这表明多步骤指令在长时间运行的工作流程中会降低。
