论文
异构文档知识图谱构建中的本体引导与去重感知提取层
An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents
摘要
大语言模型从非结构化文档中提取实体和关系流畅但不一致:文档中的类型词汇破裂,同一个人出现在多个名字变体中,关系重复,同名的个体可能无意中被忽略合并。本文介绍了生产层的设计、实现和实验性改进,该生产层将实时文档流转换为与正式语义网对齐的验证知识图谱。系统从Kafka消费文档元数据,通过为每种格式编写的处理程序将PDF、电子表格、Office文档和图像内容路由,然后在两个步骤中使用本地托管的Qwen3.5-9B模型从语义网中提取实体和关系。其突出组件是基于语义网的提取:从图数据库中实时检索相关的元组,嵌入相似性并注入到提取提示中,从而减少94%的元组开销。然后,结果通过五个阶段的精炼管道传递:确定性清洗、跨块合并、关系提取的第二步、六种无需模型推理的去重算法、冲突解决子系统,其冲突检测器无法通过相似性分数来覆盖。在智能语料库上的评估提高了搜索召回率,从大约70%提高到95%,没有合并错误,并纠正了七个类别的无声质量缺陷,从一个字符的源文本截断到重复的标题前缀的系统性重复。