论文

从图像到代码:评估多模态大模型的图形复现能力

From Pixel to Coding: Evaluating the Figure Reproduction Capabilities of MLLMs

模型评测应用与实践基准与评测资源编程视觉感知与空间理解

摘要

多模态大型语言模型 (MLLM) 在视觉理解和代码生成方面表现出了令人印象深刻的能力。然而,现有的基准通常单独评估这两种模式,缺乏对它们统一性的专门评估,即模型如何感知复杂的视觉结构并将它们合成为精确的可执行代码。此外,当前的可视化代码生成基准通常依赖于单一编程环境中的简化布局,无法评估真正的统一多模式推理。为了弥补这一差距,我们提出了 FigCodeBench,这是一个综合框架,用于严格评估 MLLM 在图形再现方面的性能,集成多模态理解和生成。我们首先设计了一个系统的数据集构建管道,总共产生了 6,194 个实例,涵盖 7 个功能类别和 4 种编程语言。我们通过视觉和代码复杂性建模将图形再现进一步分类为三层,特别针对复杂的结构推理、不同的纵横比和 密集的几何约束。我们引入了一种多维评估协议,包括视觉保真度和句法同构,与平均机器意见分数(MMOS)和人类偏好高度一致。基于我们的框架,我们对 24 个广泛使用的专有和开源 MLLM(例如 Gemini 3.1 Pro、GPT-5.4 和 Kimi-K2.5)进行了广泛的实验,在实验中我们观察到了不同编程语言和所有模型的困难场景中普遍存在的非线性性能悬崖,并获得了一些见解,例如严格的声明性语言中指标的显着下降。

从图像到代码:评估多模态大模型的图形复现能力:论文原图
图 2:FigCodeBench 概述。上图:FigCodeBench 的构建流程包括源数据采集、属性引导扰动、辅助信息提取和质量控制。左下:该画廊展示了 16 个代表性案例,分为七个功能类别,即统计可视化、关系可视化、时间可视化、组合可视化、地理空间可视化、数学可视化和概念可视化。我们在右下部分总结了该基准测试的主要特征。