论文

用大模型从辐照材料科学文本提取符合本体的知识

Extracting ontology-compliant knowledge from scientific text describing irradiated materials using large language models

上下文与知识知识图谱本体

摘要

新材料探索日益依赖从原子到宏观尺度的预测模型与综合模拟,但必要数据常以非结构化文本埋藏在科学文献中,限制复用并妨碍研究者有效利用既有知识。大模型从非结构化文本提取结构数据日益流行,传统方法却多生成简单模式的键值对。我们提出模块化流水线eolas,使用大模型自动将科学文档转为与指定本体对齐的知识图谱。我们展示其为研究聚变反应堆极端温度与辐照耐受材料的科学家提取有用信息的效果。专家从一篇文章提取相关数据可能需30—90分钟,eolas几分钟即可生成高质量图谱,并以带分面导航的表格呈现,便于人工验证。我们还提出首个用于评估大模型在辐照材料领域构建知识图谱能力的基准数据集。基于该数据集、不同大模型和提示技术开展的168项实验,提供了关键认识,我们将其总结为从输入本体有效提取对齐知识图谱的实用指南。