论文
从术语到图表:用于科学图表理解的视觉指令生成
From Terminology to Diagrams: Visual-Instruction Generation for Scientific Diagram Understanding
摘要
视觉语言模型(VLM)在使用自然图像进行视觉问答方面表现出了强大的性能。然而,他们仍然在与科学图表作斗争,这些图表旨在传达功能或关系含义,而不是字面场景。因此,我们引入了一个框架,通过利用科学课程中衍生的术语来生成大规模的基于图表的教学数据。我们的方法系统地提取领域概念,综合原子事实,从网络中检索相关图表,并以图表标题和多项选择题的形式生成多模式监督。使用此管道,我们构建了 SciGram,这是一个包含超过 194K 个图表和 140 万条视觉指令的数据集,涉及生命、地球和物理科学。尽管依赖于嘈杂的网络数据和合成注释,但在 SciGram 上微调的模型在以图表为中心的基准测试(包括 TQA、ScienceQA 和 AI2D)上实现了实质性改进,在使用更少的训练实例的情况下超越或匹配最先进的 VLM。此外,通过 SciGram 增强 LLaVA OneVision 等现有模型,在图表问答方面建立了新的最先进的性能。我们的结果强调了基于术语的指令生成作为改善科学领域视觉语言推理的一般策略的有效性。为了支持科学图表理解方面的未来研究,我们发布了 SciGram 数据集和模型。