论文
MechReason:机械工程中多图像多跳推理的基准测试
MechReason: Benchmarking Multi-Image Multi-Hop Reasoning in Mechanical Engineering
摘要
尽管在一般视觉问答和跨模态理解方面取得了重大进展,但多模态大语言模型在机械工程领域的复杂推理评估方面仍然面临着明显的差距。现有的基准测试主要关注绘图识别、CAD 解释或单图表查询等基本任务,无法评估模型在面对真实、复杂的机械问题时是否可以集成多个图像、文本条件、物理原理和工程约束来执行多步骤推理。为了解决这个问题,我们引入了 MechReason,这是一个源自真实机械工程论文的基准,包括 12k 个带有明确推理链注释的问答对和 21k 个跨越九种证据类型的视觉材料,包括统计图表、参数表、工程图纸、显微图像、仿真图像、系统架构、真实机械场景照片、CAD 模型图像和制造流程图。 MechReason 涵盖了四个推理维度的八种任务类型:解释、预测、设计和诊断。我们设计了一个四阶段的构建流程:首先提取核心工程主张,并将其支持证据分解为前提、推理过程、结论和佐证证据;然后,我们通过屏蔽后验验证信息来生成防捷径问题;最后,我们应用多模式质量验证来确保任务质量和多跳性质。大量的实验结果表明,MechReason 具有很高的挑战性,即使是最先进的模型也只能达到 62.89% 的准确率。