论文

利用越南历史教科书的本体扩展与检索自动构建树状知识图谱

Automated Tree Knowledge Graph Construction using Ontology Expansion and Retrieval from Vietnamese History Textbooks

上下文与知识知识图谱本体

摘要

基于分层知识图 (KG) 的检索增强生成 (RAG) 已成为支持具有结构化知识的大语言模型的强大方法。然而,存在主要挑战:(i)缺乏使用本体扩展对越南语等低资源语言进行自动知识图谱构建的方法,(ii)缺乏对利用层次结构的知识检索策略的系统评估。在本文中,我们提出了一种用于知识图谱构建和检索策略评估的端到端管道。在知识图谱构建中,我们采用了三相混合关系提取流程:通过Union-Find进行批次内重复数据删除、近似跨批次搜索以及使用质心过滤器进行LLM提取,该过滤器可以减少提示,并结合五步双LLM验证器来防止本体膨胀。两层架构由用于保留文档结构的不可合并结构节点和可合并内容节点组成。检索评估由三种图遍历策略组成:自上而下、水平和自下而上,这些策略在综合生成的基准上进行评估,该基准来自 109 个子图的 1,210 个越南语查询,按五个查询方向分类。在本文中,我们从越南高中历史教科书(近 400 页)构建了树知识图,以产生 750 个节点和 4,341 条语义边,并控制本体从 40 到 41 种类型的增长。在实验图遍历策略中,具有结构的自顶向下策略在 NDCG@10 中超过了向量基线 4.7 个百分点。因此,树结构信息提供了超出平坦余弦相似性的有价值的信息,但当查询不需要结构上下文时,会降低性能。

利用越南历史教科书的本体扩展与检索自动构建树状知识图谱:论文配图
图 1:分层 KG 构建的四级流程。