QRAKEN:知识图谱查询的蒸馏与语义自修复
Natural Language Questions as an Interface for Knowledge Graphs: QRAKEN Graph Distillation and Semantic Self-Healing
摘要
以自然语言访问 RDF 知识图是语义网的核心目标。 大语言模型 (LLM) 具有先进的文本到 SPARQL,但在不熟悉的图表上,它们经常生成错误表示填充数据模型的有效查询。 QRAKEN 是一个 无需训练,与本体无关的神经符号管道,以经验图证据而不是模式期望为基础。离线蒸馏器生成 TTQL,这是对填充的多跳模式、条件频率和路径条件文字示例的紧凑描述,以及类属性共现矩阵。 TTQL 在线指导 LLM,而确定性语法、词汇和数据模型检查则为迭代细化提供诊断。在 CK25(首届国际 Text2SPARQL 挑战赛)上,在 QLever 快照上的匹配条件重新计算下,QRAKEN 使用 GPT-4.1 mini 实现了 0.643 $\pm$ 0.026 的严格 F1,使用 GPT-5.4 实现了 0.652 $\pm$ 0.012 的严格 F1:相对最强的重新计算参与者分别获得了 30% 和 32% 的增益,表现优于其他参赛者使用相同基本模型系列的系统。 消融 将 TTQL 模式识别为主要驱动因素(在仅形状基线上+0.31 严格 F1);细化循环提供了一个廉价的安全网,拒绝共现矩阵不支持的三重模式。与自动派生的 SHACL 相比,TTQL 产生的严格 F1 高出 64%,支持了模式暴露之外的经验模式的价值。通过零边际成本的两个本地 35B 4 位 开放权重 模型,相同的管道可以匹配最强的重新计算参与者,并且 TTQL 相对于仅形状和 SHACL 基线的优势仍然存在。单一的、相对较小的基准测试结果提供了初步的经验信号;在非常开放的跨域图上进行整体 TTQL 注入仍然是主要限制。