论文
PolyBridgeBench:面向物理接地桥梁设计的多模态LLM基准
PolyBridgeBench: Benchmarking Multimodal LLMs for Physics-Grounded Bridge Design
摘要
多模态大语言模型(MLLM)在视觉理解与结构化生成方面表现出色,但这些能力并不能证明一个工程设计在执行时切实可行。现有基准评估空间推理、结构有效性或物理接地的建造,但它们无法判定MLLM能否综合完整的承重结构,并在仿真执行暴露失效后进行修复。我们提出PolyBridgeBench——一个可执行的多模态桥梁设计基准。模型接收视觉场景与结构化工程约束,生成完整的节点-杆件-材料拓扑。确定性合法性检查作为门控,随后进入原生动力学物理仿真。执行失败后,基准返回失败回合的时序视觉证据,并在固定交互预算下评估修复。对确定性有效性、动态功能成功与失败后恢复的分别测量,可定位设计在哪一阶段失败。六个代表性MLLM在189个关卡上的实验显示:确定性有效性与动态成功之间存在巨大落差,对材料预算高度敏感,且在主要严格预算设置下失败后恢复能力有限。
