论文
图-MMU:科学图的多模态基准
Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams
摘要
多模式 大语言模型 (MLLM) 一直在增强科学写作和协作的能力。例如,OpenAI Prism 是一个用于科学写作和协作的免费工作空间。 Prism 的一项重要功能是将科学图表直接转换为 LaTeX TikZ 代码。在本文中,我们构建了一个基准,Diagram-MMU,这是一个多模态基准,旨在评估 MLLM 的科学图表解析和理解能力。图-MMU 具有跨六个领域的 3,700 个精选图表和 18,300 个经过人工验证的问题。它针对 vivi 编写工作区中常见的三个任务评估 MLLM:图表到代码解析、图表到代码编辑和图表问答,以及每个任务的代理设置。对 12 个 MLLM 的评估表明,图到代码的任务比图问答更具挑战性:模型可以很好地推理图,但很难解析和编辑它们,这强调了需要增强 MLLM 的图到代码生成能力的方法。在代理设置下,大多数模型都提高了解析和编辑性能,但在回答问题方面却有所下降,而 Claude-4.6 Opus 在所有三项任务上都得到了持续改进。项目页面:https://vi-ocean.github.io/projects/diagram-mmu。