论文
数学视觉图:评估 LLM 数学图生成能力的综合基准
Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities
摘要
根据文本提示生成数学上精确的图表已成为 大语言模型 (LLM) 的一项关键但尚未充分开发的功能。这引起了课程准备、问题集自动排名和科学出版领域的研究人员的兴趣。 LLM 要实现这一点,需要空间推理、数学推理和渲染系统之间的完美协调。虽然现有的基准(例如 MathVision、MathVista)是为数学推理或针对通用图表生成的 DiagramGenBenchmark、MermaidSeqBench 构建的,但之前的工作没有提供一组标准化的提示、图像对,可用于专门评估数学图表生成方面的 LLM。这包括跨越文本到代码和文本到图像范例的字段。我们推出了数学视觉图,这是第一个专门设计用于评估数学图生成方面的 LLM 的基准,也是第一个在单个统一设置中一起评估文本到代码和文本到图像生成范例的基准,与底层编码语言或模型类型无关。基于 Math-Vision 基准,我们从具有基本视觉背景的高质量竞赛问题中从 3040 张图像中选择了 2920 张图像的子集。提出了一种将 LLM 与主题专家 (SME) 管理相结合的新颖管道以及一套评估指标。针对此基准测试了多个领先模型,我们证明了 LLM 难以生成数学图。所有代码、数据、管理管道和评估脚本都将完全开源。