论文

面向科学可视化素养的多模态大模型基准测试

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

模型评测模型能力评测

摘要

多模态大语言模型(MLLM)日益被用于解读可视化,但当前评估仍主要以图表为中心——对科学可视化(SciVis)理解提供的证据有限。我们在科学可视化素养评估测试上基准测试六个MLLM:一项标准化SciVis素养评估——含基于18个科学可视化与插图的49题,跨8种技术与11种任务类型。我们在封闭世界协议下评估三个闭源与三个开源模型,并以485名人类参与者的数据比较表现。结果显示:当前MLLM不呈现均匀的SciVis素养。Gemini是整体最强模型——在受评子集上超过人类均值,而开源模型仍低于人类基线。表现跨技术与任务高度不均:模型在科学插图、搜索与空间理解上最佳,但在基于纹理与基于集成的可视化及定量估计上挣扎。错误分析揭示细粒度定量估计、流向解读与落地编码解读中的反复失败。这些发现把SciVis素养定位为评估多模态AI系统的必要基准维度。代码与模型输出公开于https://github.com/patdmp/mllm-scivis-lit-benchmark。

面向科学可视化素养的多模态大模型基准测试:论文配图
图 3:细粒度定量估计难度示例。 MLLM 正确识别了等高线间隔和航路点 D,但将航路点 A 误读为位于 7200 英尺等高线上。