论文

DrawingVQA:施工图纸多深度视觉—文本推理的现实基准

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

模型评测基准与评测资源

摘要

我们提出DrawingVQA,首个评估多模态大语言模型(MLLM)在真实施工图纸上表现——图纸是建筑、土木及众多工程实践中的核心媒介。与自然图像或示意性平面图不同,施工图纸融合了抽象几何、符号标记、表格数据、注释与领域专用文本,构成工程工作流核心中独特复杂的视觉—文本领域。DrawingVQA以33张“施工版”图纸和92个专家精编问答对弥合这一空白,覆盖三个推理深度:感知理解、上下文解释与领域专家推理。为评估模型能力,我们提出双重分类框架,联合分析七个建筑工程维度与四个MLLM能力维度上的表现——首次显式地把工程工作流映射到AI推理能力。对最先进MLLM的评估显示,模型与专家表现之间存在显著差距,在更高推理深度上尤甚。该基准为领域专用的多模态推理奠定基础,推动AI驱动的理解与真实工程工作流的结合。

DrawingVQA:施工图纸多深度视觉—文本推理的现实基准:论文配图
图 1:IFC 绘图和 DrawingVQA 工程级 VQA 的多模态挑战。 (A) 解构 IFC 图纸的复杂性:现实世界中的“施工签发”(IFC) 图纸是信息密集的工件,带来了独特的多模态挑战(参见第 3.2 节)。 (B) DrawingVQA VQA 示例:我们提供来自 DrawingVQA 的具有挑战性的问答对,需要行业专业的工程推理,按我们的三个推理深度分类(用星号表示:⋆\star 感知、⋆⁣⋆\star\star 上下文、⋆⋆⋆⋆\star\star\star 专家级知识和推理)。每个示例都映射到特定的 MLLM 功能(例如 OCR、视觉感知、知识、推理)和建筑工程 (CE) 任务(例如 QTO、设计理解、元素识别、合规性)。这些任务远远超出了学术基准(参见第 3.4 节)。