论文
SCAFFOLD:包含图示问答与思维链推理轨迹的大规模结构化计算机科学研究配图数据集
SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces
摘要
计算机科学论文严重依赖图表:架构图、系统流程图和管道原理图,它们通常比周围的文本包含更多信息。目前还没有公共数据集将这种特定类型的图形与标题、上下文、问题、答案和逐步推理配对,而这正是训练视觉语言模型来理解它们所需要的。我们提出了 \textbf{SCAFFOLD}\footnote{https://github.com/theranjitraut/scaffold},这是一个包含图表 QA 和思想链推理轨迹的计算机科学研究数据的大规模结构化数据集。该数据集由来自 arXiv 计算机科学论文的(图像、标题、上下文、问题答案、思想链)元组组成,这些元组使用布局检测和 PDF 解析准备,并具有人工智能辅助的问题生成步骤。由此产生的大型 SCAFFOLD-157K 数据集涵盖 3,058 篇论文,包含 29,887 个图(157,387 对)、一个中型 SCAFFOLD-37K 数据集(36,797 对)和一个小型 SCAFFOLD-12K 数据集(12,000 对)。我们使用 SCAFFOLD-12K 在 Qwen2.5-VL-3B-Instruct 上进行基线实验。
