论文
MMArch:基于建筑与土木工程证据的多模态推理基准
MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence
摘要
多模态大语言模型(MLLM)在工程图像上表现强劲,但现有基准大多测试图纸识别、信息提取或合规检查,模型能否将分散的视觉证据与工程原理结合得出结论仍是开放问题。我们提出 MMArch,一个覆盖十个子领域、完全基于同行评审论文插图的建筑与土木工程基准。其 1,212 道简答题由解耦的规划器-写作器管线生成,并经过自动筛查、盲对抗审计和专家评审验证,因此作答需要感知相关证据、识别支配性原理并加以应用,而非利用文本或单图捷径。将 18 个开源与专有 MLLM 与领域专家小组对比评估,我们发现差距巨大:最强的开源模型约达 30%,最佳专有系统达 52%,而人类专家达到 95%,领先四十多个百分点。我们的错误分析显示,失败集中在应用原理和跨图组合证据,而非定位证据,为未来研究指出了可观空间。代码与数据见 https://dcx-swjtu.github.io/MMArch/。
