论文

从 大语言模型 大规模构建消除歧义的知识库

Constructing Disambiguated Knowledge Bases from Large Language Models at Scale

上下文与知识知识图谱

摘要

自动化知识库构建(AKBC)是 NLP 的核心任务,最近的工作提出直接从 大语言模型(LLM)生成知识库,将模型本身视为知识源。然而,LLM 本身不具有实体的表示,从而导致重复条目和混淆。我们提出了 GPTKB 2.0,一种直接从 LLM 构建消除歧义的知识库的方法。 GPTKB 2.0 结合了实体、关系和类的动态消歧,并且经过精心设计,以满足可扩展性和消歧准确性。我们分析核心设计决策并描述准确性、规模和成本之间的权衡。我们大规模执行 GPTKB 2.0,获得包含超过 100 万个消歧实体和 3840 万个三元组的物化 KB。这代表了第一个百万级 LLM 原生知识库,具有实体、关系和类的显式内部规范化,与之前以维基媒体为中心的作品有很大不同。 GPTKB 2.0 可从 https://gptkb.org/ 获取。