论文

SpecVQA:面向科学图像光谱理解与视觉问答的基准

SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images

模型评测基准与评测资源

摘要

光谱是一类常见但信息密度极高的科学图像,其非结构化与领域特定的特性给多模态大语言模型(MLLM)带来巨大挑战。我们在此提出SpecVQA,一个用于评估多模态模型科学光谱理解能力的专业科学图像基准,覆盖7种代表性光谱类型,配有专家标注的问答对。其目标包含两个方面:光谱科学问答评估以及相应的底层任务评估。SpecVQA包含从同行评审文献中精选的620幅图与3100个问答对,同时面向直接信息抽取与领域特定推理。为在有效缩减token长度的同时保留关键曲线特征,我们提出一种光谱数据采样与插值重建方法。消融研究进一步证实,该方法在所提基准上带来显著的性能提升。我们在本基准上测试了知名MLLM的科学光谱理解能力,并给出排行榜。这项工作是提升多模态大模型光谱理解能力的关键一步,并为将视觉语言模型拓展到更广泛的科学研究与数据分析指明了有前景的方向。

SpecVQA:面向科学图像光谱理解与视觉问答的基准:论文配图
图 1:数据管理概述和建议的 SpecVQA 基准。第一阶段自动从同行评审的期刊中获取高质量的图形标题对。第 2 阶段执行多级过滤和频谱类型分类,在专家监督下生成一组精选的 20k 频谱-标题对。第 3 阶段利用 MLLM 从策划的数据中提取 QA 对;然后,领域专家重新注释代表性案例并将其分配给两个语义类别。第 4 阶段合成了额外的 201k 个基础样本,以支持模型评估并评估我们采样策略的有效性。