论文

VLM像工程师一样推理吗?一个基准与分阶段评估

Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 在一般多模态推理基准上表现出强大的性能,但其执行工程推理的能力在很大程度上仍未得到探索。与一般的视觉问答不同,工程问题的解决需要解释技术图表,选择控制物理原理,并保持物理一致的多步骤推理。这些功能对于工程教育、科学援助和技术决策中使用的人工智能系统越来越重要,在这些系统中,推理失败可能会产生物理上无效但表面上合理的解决方案。现有的基准主要评估最终答案,并对中间推理过程提供有限的评估。我们引入了 EngVQA,这是一个多模态基准,用于评估包含 696 个问题的 5 个工程学科的工程推理。我们引入了一个 8 阶段自动评估框架来评估 VLM 生成的解决方案。该框架独立评估解决方案的每个阶段,从而能够对推理失败进行细粒度分析。我们在评估框架上对多个最先进的开源和闭源 VLM 进行了基准测试,并证明了当前工程推理能力的重大局限性。人工评估与我们的自动化框架高度一致,在 10 分评分量表上实现了 0.975 的皮尔逊相关性和 0.67 的平均绝对误差。我们的结果强调了面向过程的评估对于多模态工程推理系统的可靠评估的重要性。

VLM像工程师一样推理吗?一个基准与分阶段评估:论文配图
图 2:拟议的 EngJudge 评估框架概述。答:VLM 为包含文本和技术图表的工程问题生成结构化的逐步解决方案。 B. 解决方案被分解为八个推理阶段,每个推理阶段都使用标题引导的大语言模型作为法官提示(App F.3)进行独立评估,并进行基于惩罚的评分和致命错误检测。 C. 然后,阶段分数通过依赖图传播(颜色对应于 B. 中的步骤),D. 使用元评估检查进行聚合,以产生 0-10 等级的最终可解释分数。