论文
SpecVQA:面向科学图像光谱理解与视觉问答的基准
SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images
摘要
光谱是一类常见但信息密度极高的科学图像,其非结构化与领域特定的特性给多模态大语言模型(MLLM)带来巨大挑战。我们在此提出SpecVQA,一个用于评估多模态模型科学光谱理解能力的专业科学图像基准,覆盖7种代表性光谱类型,配有专家标注的问答对。其目标包含两个方面:光谱科学问答评估以及相应的底层任务评估。SpecVQA包含从同行评审文献中精选的620幅图与3100个问答对,同时面向直接信息抽取与领域特定推理。为在有效缩减token长度的同时保留关键曲线特征,我们提出一种光谱数据采样与插值重建方法。消融研究进一步证实,该方法在所提基准上带来显著的性能提升。我们在本基准上测试了知名MLLM的科学光谱理解能力,并给出排行榜。这项工作是提升多模态大模型光谱理解能力的关键一步,并为将视觉语言模型拓展到更广泛的科学研究与数据分析指明了有前景的方向。
