论文

SciIR:科学图像推理生成的大规模训练数据集和基准

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

模型评测基准与评测资源

摘要

虽然文本到图像 (T2I) 模型在生成逼真的视觉内容方面取得了显着的成功,但它们仍然难以满足科学图像所需的严格语义对齐和逻辑推理。受皮尔士符号学三元组的启发,我们引入了科学图像推理(SciIR),这是一种用于训练和评估科学图像生成的综合资源。我们将科学推理形式化为三个核心维度:实体结构(图标)、科学过程(索引)和科学规律(符号)。具体来说,为了克服科学图像生成中训练数据的稀缺问题,我们精心创建了 SciIR-82k,这是一个包含来自尖端出版物的 80,000 多个高质量科学图像文本对的大型数据集。该数据集根据符号学维度进行分层组织,并结合科学推理思想链 (Sci-RCoT) 来显式建模底层视觉逻辑。为了进行评估,我们提出了 SciIR-Bench,它与这三个符号学级别保持一致,并采用原子检查表将面向结果的科学准确性转化为面向过程的、可验证的、细粒度的问题。我们广泛的实验揭示了当前模型的科学推理能力的重大缺陷。此外,通过微调在SciIR-82k数据集上,我们开发了Qwen-Image-SciIR模型,该模型在SciIR-Bench上实现了实质性改进,将最终得分从35%提高到43%,为科学图像生成的未来进步奠定了坚实的基础。