论文

ChartNet:百万规模的高质量多模态数据集,用于强大的图表理解

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

模型训练合成数据

摘要

理解图表需要模型对几何视觉模式、结构化数值数据和自然语言进行联合推理——当前视觉语言模型 (VLM) 的能力仍然有限。我们推出 ChartNet,这是一个高质量、百万规模的多模式数据集,旨在推进图表解释和推理。 ChartNet 利用新颖的代码引导合成管道生成 150 万个不同的图表样本,涵盖 24 种图表类型和 6 个绘图库。每个样本由五个对齐的组件组成:绘图代码、渲染的图表图像、数据表格、自然语言摘要和推理问答,提供细粒度的跨模态对齐。为了捕获图表理解的全部范围,ChartNet 还包括专门的子集,包括人类注释数据、真实世界数据、安全性和基础。此外,严格的质量过滤管道可确保图表表示的视觉保真度、语义准确性和多样性。 ChartNet 上的 微调 不断改进基准测试的结果,证明了其作为多模式模型大规模监督的实用性。作为同类中最大的开源数据集,ChartNet 旨在支持基础模型的开发,这些模型具有强大且可泛化的数据可视化理解能力。该数据集可在 https://huggingface.co/datasets/ibm-granite/ChartNet 上公开获取