论文

以SQL符号能力支持无需专项微调的幻觉核验

Leveraging Low-Level Symbolic Competences for Unsupervised Grounding in Hallucination Detection

模型推理推理验证与自校正

摘要

幻觉——语言模型生成实际上不正确或不受源支持的输出——对于提示语言模型和微调语言模型来说都是一个重大挑战。由于 LLM 的推理过程不透明,检测幻觉很困难,这通常无法深入了解模型输出可能不准确的原因。在这项工作中,我们研究 LLM 是否可以使用替代的低级符号能力(例如 SQL)在某些高级任务中进行无监督幻觉检测。为此,我们根据参考文档制作了 LLM 构建 SQL 数据库。然后,该 SQL 数据库用于对基于数据库的幻觉检测管道中的参考和采样响应进行推理,从而提供神经符号检查。在 RAGTruth 和 DiaHalu 幻觉检测数据集上,我们发现我们的方法改进了直接预测,并与最先进的幻觉检测方法竞争,同时不需要特定领域的 微调。相反,它依赖于 LLM 中已经存在的低级一般能力。这需要进一步研究神经符号方法中低水平的 LLM 能力。