论文

MMArch:基于建筑与土木工程证据的多模态推理基准

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

模型评测基准与评测资源

摘要

多模态大语言模型(MLLM)在工程图像上表现强劲,但现有基准大多测试图纸识别、信息提取或合规检查,模型能否将分散的视觉证据与工程原理结合得出结论仍是开放问题。我们提出 MMArch,一个覆盖十个子领域、完全基于同行评审论文插图的建筑与土木工程基准。其 1,212 道简答题由解耦的规划器-写作器管线生成,并经过自动筛查、盲对抗审计和专家评审验证,因此作答需要感知相关证据、识别支配性原理并加以应用,而非利用文本或单图捷径。将 18 个开源与专有 MLLM 与领域专家小组对比评估,我们发现差距巨大:最强的开源模型约达 30%,最佳专有系统达 52%,而人类专家达到 95%,领先四十多个百分点。我们的错误分析显示,失败集中在应用原理和跨图组合证据,而非定位证据,为未来研究指出了可观空间。代码与数据见 https://dcx-swjtu.github.io/MMArch/。

MMArch:基于建筑与土木工程证据的多模态推理基准:论文配图
图1:MMArch概览。左:需要在各图示面板间联合阅读证据并应用相应工程原理来作答的代表性题目;对于其中一道题,我们还展示了其底层推理过程,该内容仅用于说明该题为何具有诊断性,绝不会暴露给被评估的模型。中:我们错误分析得到的错误类别聚合分布。右:人类评审小组与代表性MLLM在MMArch上的准确率(%);每个被评估模型都落后人类四十多个百分点。