论文
MatMMExtract:用于从材料科学文献中面板级提取有区域对应依据的图像文本对的开源管道
MatMMExtract: An Open-Source Pipeline for Panel-Level Extraction of Grounded Image-Text Pairs from Materials Science Literature
摘要
材料科学文献以数字形式编码了数十年的实验知识,但这种视觉记录仍然被锁定,人工智能无法大规模访问。核心困难在于结构:大多数科学图表都是复合的,单条图注同时描述多个子面板,使得直接的图像文本配对不可靠。我们推出了 MatMMExtract,这是一个端到端的开源管道,它通过将复合图形分解为单独的子面板并使用由策划的材料科学分类法指导的 大语言模型 生成结构化的、有依据的注释来解决这个问题。 MatMMExtract 应用于 14,810 篇开放获取文章,生成 MatSciFig;来自 180,571 个图形的 391,606 个面板级图像文本对,每个都带有子图图注注释、跨越 19 个类别和 100 多个子类型的两级可视化类别以及科学摘要。为了实现准确的面板定位,我们引入了 MaterialScope,这是一个包含 2,811 个手动注释的材料科学图形的特定领域检测数据集,经过微调的 YOLO12-m 检测器可实现 0.9227 的 mAP_50。在六种基准语言模型中,Gemini 3.1 Flash Lite 为注释生成提供了最佳的成本质量权衡,82% 的输出被评为良好,幻觉率为 4.8%。 MatSciFig 上的双编码器检索基线在 R@1 上比零样本 CLIP 提高了 4.4 倍,证明了该数据集对视觉语言学习的直接效用。所有资源均向社区公开发布。