论文

HGNet:用于从科学文献自动生成知识图的可扩展基础模型

HGNet: Scalable Foundation Model for Automated Knowledge Graph Generation from Scientific Literature

上下文与知识知识图谱

摘要

自动化知识图 (KG) 构建对于浏览快速扩展的科学文献至关重要。然而,现有的方法很难识别长的多词实体,通常无法跨领域泛化,并且通常忽视科学知识的层次性质。虽然通用 大语言模型 (LLM) 提供了适应性,但它​​们的计算成本很高,并且在专门任务上产生不一致的精度。因此,当前的知识图谱很浅且不一致,限制了它们在探索和综合方面的效用。我们提出了一个可扩展、零样本科学知识图谱构建的两阶段框架。第一阶段 Z-NERD 引入了 (i) 正交语义分解 (OSD),它通过隔离文本中的语义“转向”来促进与领域无关的实体识别,以及 (ii) 多尺度 TCQK 注意力机制,通过 n 元语法感知注意力头捕获连贯的多词实体。第二阶段 HGNet 通过层次结构感知消息传递执行关系提取,显式建模父、子和对等关系。为了加强全局一致性,我们引入了两个互补的目标:可微分层次损失(Differentiable Hierarchy Loss)以阻止循环和快捷边缘,以及连续抽象场(CAF)损失(Continuum Abstraction Field (CAF) Loss),其沿着欧几里德空间中的可学习轴嵌入抽象级别。这是第一种将层次抽象形式化为标准欧几里德嵌入中的连续属性的方法,为双曲线方法提供了更简单的替代方案。我们发布了 SPHERE (https://github.com/basiralab/SPHERE),这是一个用于层次关系提取的多域基准。我们的框架在 SciERC、SciER 和 SPHERE 上建立了新的技术水平,在分布外测试中将 NER 提高了 8.08%,将 RE 提高了 5.99%。在零样本设置中,NER 的增益达到 10.76%,RE 的增益达到 26.2%。