论文
DrawingVQA:施工图纸多深度视觉—文本推理的现实基准
DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings
摘要
我们提出DrawingVQA,首个评估多模态大语言模型(MLLM)在真实施工图纸上表现——图纸是建筑、土木及众多工程实践中的核心媒介。与自然图像或示意性平面图不同,施工图纸融合了抽象几何、符号标记、表格数据、注释与领域专用文本,构成工程工作流核心中独特复杂的视觉—文本领域。DrawingVQA以33张“施工版”图纸和92个专家精编问答对弥合这一空白,覆盖三个推理深度:感知理解、上下文解释与领域专家推理。为评估模型能力,我们提出双重分类框架,联合分析七个建筑工程维度与四个MLLM能力维度上的表现——首次显式地把工程工作流映射到AI推理能力。对最先进MLLM的评估显示,模型与专家表现之间存在显著差距,在更高推理深度上尤甚。该基准为领域专用的多模态推理奠定基础,推动AI驱动的理解与真实工程工作流的结合。
