论文
面向科学可视化素养的多模态大模型基准测试
Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy
摘要
多模态大语言模型(MLLM)日益被用于解读可视化,但当前评估仍主要以图表为中心——对科学可视化(SciVis)理解提供的证据有限。我们在科学可视化素养评估测试上基准测试六个MLLM:一项标准化SciVis素养评估——含基于18个科学可视化与插图的49题,跨8种技术与11种任务类型。我们在封闭世界协议下评估三个闭源与三个开源模型,并以485名人类参与者的数据比较表现。结果显示:当前MLLM不呈现均匀的SciVis素养。Gemini是整体最强模型——在受评子集上超过人类均值,而开源模型仍低于人类基线。表现跨技术与任务高度不均:模型在科学插图、搜索与空间理解上最佳,但在基于纹理与基于集成的可视化及定量估计上挣扎。错误分析揭示细粒度定量估计、流向解读与落地编码解读中的反复失败。这些发现把SciVis素养定位为评估多模态AI系统的必要基准维度。代码与模型输出公开于https://github.com/patdmp/mllm-scivis-lit-benchmark。
