论文

从论文到属性表:一种基于优先级的LLM材料数据抽取工作流

From Papers to Property Tables: A Priority-Based LLM Workflow for Materials Data Extraction

应用与实践科学研究

摘要

科学数据广泛分散于研究论文之中,且在文本、表格和图中的报告方式常常不一致,使得人工数据抽取与汇总既缓慢又容易出错。我们提出一种由提示驱动、分层式的工作流,利用大语言模型(LLM)自动抽取并重建结构化的、发次级(shot-level)冲击物理实验记录:它整合分布于全文已发表论文中的文本、表格、图与基于物理的推导信息,并以合金层裂强度作为代表性案例研究。该流程针对每发实验的37个实验相关字段,并采用三级优先级策略:(T1)从文本/表格直接抽取,(T2)利用经验证的支配关系进行基于物理的推导,(T3)必要时从图中数字化。抽取值被归一化到规范单位,按优先级打标以保证可追溯性,并通过基于物理的一致性与合理性检查加以验证。在由30篇已发表论文、11,967个评估数据点构成的基准上评估,该工作流取得了很高的总体准确率:分级准确率分别为94.93%(T1)、92.04%(T2)与83.49%(T3),总体加权准确率为94.69%。跨模型测试进一步表明,文本/表格与公式推导字段具有很强的一致性,而基于图的抽取一致性较低。通过API接口的实现证明了该方法的可扩展性,取得了稳定的抽取性能,且在部分测试用例中达到甚至超过基于对话方式的准确率。该工作流展示了一条无需任务特定微调即可将非结构化技术文献转化为可追溯、可直接分析数据集的实用路径,使材料科学中可扩展的数据库建设成为可能。

从论文到属性表:一种基于优先级的LLM材料数据抽取工作流:论文配图
图1:基于LLM从文献文档提取材料数据的提示词开发与迭代优化流程,对应论文的优先级驱动数据提取工作流。