论文

AECV-Bench:评测多模态模型的建筑与工程图纸理解能力

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

模型评测基准与评测资源

摘要

AEC图纸通过符号、布局规范和密集标注来编码几何与语义,但现代多模态与视觉语言模型能否可靠解读这种图形语言,仍不清楚。我们提出AECV-Bench,一个在真实AEC制品上评测多模态与视觉语言模型的基准,通过两个互补用例进行:(i)在120张高质量平面图上进行物体计数(门、窗、卧室、卫生间);(ii)以图纸为依据的文档问答,覆盖192组问答对,测试文本抽取(OCR)、实例计数、空间推理以及对图纸常见区域的比较推理。物体计数性能以逐字段精确匹配准确率和MAPE结果报告,文档问答性能以总体准确率和逐类别细分报告,并采用LLM-as-a-judge评分流水线以及针对边缘情况的人工裁定。在统一协议下评测一大批最先进模型后,我们观察到一条稳定的能力梯度:OCR和以文本为中心的文档问答最强(准确率最高0.95),空间推理居中,而以符号为中心的图纸理解——尤其是对门和窗的可靠计数——仍未解决(准确率常为0.40—0.55),且比例误差可观。这些结果表明,当前系统可以很好地充当文档助手,但缺乏稳健的图纸素养,这促使人们为高效的AEC自动化开发领域专用表示以及工具增强、人在回路的工作流。