论文

ArticleMiner:本体引导的科学出版物知识图谱构建

ArticleMiner: Ontology-Guided Knowledge Graph Construction from Scientific Publications

上下文与知识知识图谱本体

摘要

科学论文把大量定量内容放在表格与补充文件中,其中一个数字只有结合其表头、题注、单位、分析方法与领域惯例才有意义。因此,恢复表格的行列并不等于恢复它所报告的科学事实。大多数语义表格解释方法假设已有干净表格,然后将单元格或列映射到本体术语;而大多数出版物级抽取系统则为单一领域设计。我们研究一条中间路径:一个共享流程读取论文及其补充文件,从多个解析器与一个语言模型收集证据并加以调和,同时由每个任务一个有界的人工编写任务模块提供领域含义。该模块列出图谱可用的规范名称、映射到它们的表面形式、一小组推导规则与有效性约束、身份键,以及用于写出 RDF 的绑定。它定义一个任务允许输出什么,而不试图穷举某领域的全部惯例。我们在 ArticleMiner 框架下构建了四个这样的模块(药物发现化学、材料科学、机器学习与矿物地球化学),并在 163 篇论文上评估,包括一个带专家整理真值的新地球化学基准。在与同 LLM 少样本基线的比较中,点估计在全部四个任务上都倾向 ArticleMiner,在两个较小基准上存在不确定性。地球化学比较还包含对补充文件的访问,因此其改进不能仅归因于领域引导。

ArticleMiner:本体引导的科学出版物知识图谱构建:论文配图
图 1:共享编排与任务模块集成(示意)。解析保留源位置;抽取提出记录;针对性重试处理缺失或不可读的证据。调和应用推导、规范化、验证以及基于身份的合并。JSON-LD 输出所得记录;Turtle 与图查询标签描绘预期的下游用途,而非被评估的原生输出。后端支持衡量的是身份恢复能力,而非事实正确性。