论文
宁迟勿早:通过本体约束的抽取后校正构建神经符号知识图谱
Better Later Than Sooner: Neuro-Symbolic Knowledge Graph Construction via Ontology-grounded Post-extraction Correction
摘要
问答(Question Answering,QA)是AI的核心挑战,尤其是需要跨文档多跳推理或聚合、穷举列举等符号操作的复杂查询。检索增强生成(RAG)已成为问答的主流方法,近期的图谱变体通过组织知识以更好地支持组合式问题,部分解决了这些问题。然而,大多数基于文本图的RAG方法仍然缺乏可靠回答复杂问题所需的符号操作结构。这催生了符号化图谱方法:抽取知识图谱(Knowledge Graph,KG),其关系是逻辑谓词,从而支持类SQL查询。但这类流水线通常用LLM做KG抽取,可能引入一致性问题——抽取出的事实可能违反常识性的本体约束。我们提出一个面向本体约束KG构建的神经符号框架,结合开放域抽取、基于嵌入的类型与谓词规范化,以及针对本体违例的LLM定向校正。通过把校正推迟到抽取后阶段,我们的方法避免了重复的LLM调用,在大幅降低token用量的同时提升了KG一致性,并保持下游QA质量。最后,我们通过测量SPARQL图模式的出现频率,证明抽取出的KG非常适合符号查询。
