论文
KG2Code:以可执行代码连接知识图谱与大语言模型进行问答
KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering
摘要
近期研究探索了将知识图谱(KG)与大语言模型(LLM)集成,以提升其在下游知识密集型任务尤其是知识图谱问答(KGQA)上的表现。现有方法主要通过基于检索增强生成(RAG)、基于智能体以及基于SPARQL的方式将LLM与KG结合。尽管这些方法取得了显著成功,但仍存在若干局限,包括结构信息丢失、推理不忠实以及灵活性与泛化能力有限。为应对这些挑战,本文提出KG2Code,一种将知识图谱转化为基于代码的表示的新方法,既保留结构语义,又与现代LLM的代码感知预训练自然对齐。在KG2Code基础上,进一步提出KG2Code-QA,一个将KGQA形式化为代码生成任务的KGQA框架。这种形式化能够生成可验证的推理轨迹与可执行代码,从而大幅减轻幻觉的影响。此外,还开发了自动化流水线来构建大规模高质量代码语料库,以有效训练开源LLM掌握KG2Code-QA。训练之后,LLM能够在零样本场景下执行KGQA。大量实验表明,所提方法在KGQA上显著优于现有KG增强的LLM方法,并对未见过的KG展现出强泛化能力。代码与数据已在Github上开放。
