论文

Enginuity:工程图视觉语言理解的数据集和基准

Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams

模型评测基准与评测资源

摘要

工程图对视觉语言模型提出了独特的挑战:与自然图像或一般文档不同,它们通过密集的空间布局、特定领域的符号以及视觉标注和结构化零件表之间的交叉引用来编码信息。尽管 VLM 是服务、维修和设计工作流程的核心,但目前还没有衡量该领域 VLM 功能的公共基准;现有数据集主要关注流程图、科学图表或商业文档。为了弥补这一差距,我们引入了 Enginuity,这是第一个用于在复杂工程图上评估 VLM 的开放数据集和基准。我们在美国军事服务和维修手册的语料库上定义了两项任务:结构化零件表提取(任务 1)和用于基准测试的自由格式可视化图问答(VQA)(任务 2)。我们在零样本和思维链提示下评估了四个前沿 VLM(GPT-5.2 Chat、Claude Opus 4.7、Gemma 4、Qwen3-VL-32B-Instruct)。在任务 1 中,模型的 Recall@all 达到 0.61-0.87,但 Token F1pen 仅为 0.03-0.18,暴露了零件识别和描述保真度之间的系统差距。任务 2 揭示了所有模型之间一致的事实推理差距。支持分析表明,相对于语义相似性,词元重叠指标低估了技术描述的模型能力 2-6 倍,从而激发了 LLM 作为法官校准以进行特定领域的评估。我们发布数据集、注释、评估工具和每个样本模型输出,以支持 VLM 功能在工程内容上的可重复研究。