论文
差距和重叠分析的基准作为 KG 任务准备情况的测试
A Benchmark for Gap and Overlap Analysis as a Test of KG Task Readiness
摘要
对知识图(KG)质量的面向任务的评估越来越多地询问基于本体的表示是否能够以可重复、可解释和可追溯证据的方式回答用户真正关心的能力问题。本文采用这一观点,重点关注政策类文件(例如保险合同)的差距和重叠分析,在给定的情况下,哪些文件支持它(重叠),哪些文件不支持(差距),并有合理的理由。由此产生的间隙/重叠确定通常是由覆盖范围和限制方面的真正差异驱动的,而不是由缺失数据驱动的,这使得该任务成为对 KG 任务准备情况的直接测试,而不是对缺失事实或查询表达能力的测试。我们提出了一个可执行且可审计的基准,将自然语言合同文本与正式本体论和证据相关的 真值 结合起来,从而实现方法的系统比较。该基准包括:(i) 由领域专家审核的 10 份简化但多样化的人寿保险合同,(ii) 领域本体 (TBox),其中包含由合同事实填充的实例化知识库 (ABox),以及 (iii) 58 个结构化场景,与 SPARQL 查询配对,其中包含合同级结果和条款级摘录,可证明每个标签的合理性。使用此资源,我们将直接从合同文本推断结果的纯文本 LLM 基线与通过实例化知识图谱回答相同场景的本体驱动管道进行比较,证明显式建模提高了差距/重叠分析的一致性和诊断。尽管已针对差距和重叠分析进行了论证,但该基准旨在作为可重复使用的模板,用于评估知识图谱质量并支持下游工作,例如本体学习、知识图谱群体和基于证据的问答。