论文

MechVQA:对综合机械绘图理解进行多模式 LLM 基准测试和增强

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在一般视觉问答 (VQA) 任务中取得了显着的成就。然而,它们在机械工程图纸上仍然很脆弱,其中高注释密度和薄弱的领域知识,再加上严格的投影规则和几何约束下不可靠的空间关系推理,使得决定性线索很容易被错过,并经常导致错误的答案。为了弥补这一差距,我们引入了第一个全面的机械绘图理解数据集 MechVQA,它是通过半自动化构建和质量控制管道创建的。 MechVQA 包含 3.3k 张高密度图片和 21K 个问答对,跨越三个能力级别的 10 个不同的细粒度任务:识别、推理和判断,提供了一个测试平台来评估和提高 MLLM 对现实机械绘图的理解。在 MechVQA 之上,我们通过多阶段训练范例开发 MechVL 模型,构建强大的领域专业基线。大量实验结果表明,MechVL 在 MechVQA 总分上比最强的闭源基线高出 7.57 个百分点,显着增强了机械绘图理解能力,并为在机械设计和检测场景中部署 MLLM 提供了可重用的基础。