论文

KG-Guard:用于知识库问答的基于图的幻觉检测

KG-Guard: Graph-Based Hallucination Detection for Knowledge Base Question Answering

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地用于知识库问答 (KBQA),其中回答需要从特定于问题的知识图子图中选择实体。然而,众所周知,LLM 会产生跨任务的幻觉,KBQA 也不例外:即使我们提供图作为知识源,模型也可能依赖于参数知识而不是图证据,或者对给定关系执行无效推理。这种幻觉的答案节点可能会限制 KBQA 系统的实际部署,特别是在医疗保健等高风险领域。我们将 KBQA 中的幻觉检测制定为答案节点分类问题,并提出了一个轻量级的基于图的框架,将答案 LLM 视为黑匣子。 \methodname 将每个 KBQA 实例表示为增强图。它使用 KG 实体的语义表示来初始化节点特征,使用学习向量标记主题实体和 LLM 提出的答案节点,并将虚拟问题节点连接到主题实体。然后,图编码器生成面向验证的节点表示,小型 MLP 使用其图表示和问题嵌入对每个建议的答案节点进行分类。在 WebQSP、ComplexWebQuestions 和 PUGG 上的实验表明,我们的检测器在所有三个基准($82.0$、$87.4$ 和 $84.3$)上实现了最高的 F1,优于 LLM 作为判断和基于采样的基线,同时参数比参考方法少 $\sim305\times$。除了检测之外,节点级反馈是可操作的:当标记的答案反馈到 KBQA 系统进行迭代细化时,下游 KBQA F1 提高了 $13.0$-$14.5$ 点,精确匹配提高了 $16.9$-$17.6$ 点。