论文

PolyBridgeBench:面向物理接地桥梁设计的多模态LLM基准

PolyBridgeBench: Benchmarking Multimodal LLMs for Physics-Grounded Bridge Design

智能体系统Agent任务评测

摘要

多模态大语言模型(MLLM)在视觉理解与结构化生成方面表现出色,但这些能力并不能证明一个工程设计在执行时切实可行。现有基准评估空间推理、结构有效性或物理接地的建造,但它们无法判定MLLM能否综合完整的承重结构,并在仿真执行暴露失效后进行修复。我们提出PolyBridgeBench——一个可执行的多模态桥梁设计基准。模型接收视觉场景与结构化工程约束,生成完整的节点-杆件-材料拓扑。确定性合法性检查作为门控,随后进入原生动力学物理仿真。执行失败后,基准返回失败回合的时序视觉证据,并在固定交互预算下评估修复。对确定性有效性、动态功能成功与失败后恢复的分别测量,可定位设计在哪一阶段失败。六个代表性MLLM在189个关卡上的实验显示:确定性有效性与动态成功之间存在巨大落差,对材料预算高度敏感,且在主要严格预算设置下失败后恢复能力有限。

PolyBridgeBench:面向物理接地桥梁设计的多模态LLM基准:论文配图
图 1:PolyBridgeBench 概览。输入将视觉场景与结构化材料、载荷、几何形状及预算约束相结合。每次模型调用生成一个完整拓扑。无效候选会收到文本形式的约束反馈并返回合成阶段,不进入物理仿真;有效候选则在原生模拟器中执行。物理失效会返回该次 rollout 的时间帧序列,而功能成功则要求所有车辆到达其目标。两条修复路径共享固定的交互预算。