论文

BLINKG:融合LLM的知识图谱生成基准

BLINKG: A Benchmark for LLM-Integrated Knowledge Graph Generation

模型评测上下文与知识本体基准与评测资源

摘要

生成知识图谱(KG)仍是知识工程师最耗时、最费人力的任务之一,因为他们需要识别输入数据源与本体术语之间的语义等价关系。尽管声明式方案(如RML、SPARQL-Anything)已帮助将这一过程通用化,但将输入模式元素与本体术语对齐仍涉及复杂的转换并需要大量人工投入。随着大语言模型(LLM)的出现,利用其能力辅助KG工程师的兴趣日益增长。尽管一些研究已探索用LLM自动化KG构建,仍缺乏标准化框架来评估它们在数据模式与本体概念之间建立对应关系的有效程度。因此,本文提出BLINKG,一个旨在评估LLM从异构数据源构建KG时映射能力的基准。该基准包含一组基于真实用例、复杂度递增的场景。我们使用BLINK对多个最先进的LLM进行了广泛的实验评估,观察到它们已能提供有前景的解决方案。然而它们在复杂场景中的表现仍然有限。依托该基准,我们已能评估LLM在KG构建上的现有能力。此外,我们定义了实现(半)自动化(LLM驱动)KG构建的一组需求,开辟了该领域的新研究方向。

BLINKG:融合LLM的知识图谱生成基准:论文配图
(a) 1A 的相似度得分 (b) 1B 的相似度得分 (c) 1C 的相似度得分 (d) 1D 的相似度得分 (e) 1E 的相似度得分 (f) 1F 的相似度得分 (g) 1G 的相似度得分 (h) 1H 的相似度得分 图 4:八个配置相对于场景 1 中黄金标准的相似度得分。