论文

使用转移解码进行 大语言模型 中的幻觉检测

Hallucination Detection in Large Language Models Using Diversion Decoding

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 已成为通过无缝、类人交互检索知识的强大工具。尽管 LLM 具有先进的文本生成功能,但它们表现出幻觉倾向,它们会生成事实上不正确的陈述并捏造知识,从而破坏了其可靠性和可信度。多项研究探索了评估 LLM 不确定性和检测幻觉的方法。然而,现有的方法通常是概率性的且计算成本昂贵,限制了它们的实际适用性。在本文中,我们介绍了转移解码,这是一种通过在解码阶段主动挑战模型生成的响应来开发 LLM 不确定性启发式的新颖方法。通过转移解码,我们提取了捕获 LLM 抵抗产生替代答案的特征,并利用这些特征来训练机器学习模型,以开发 LLM 不确定性的启发式测量。我们的实验结果表明,转移解码的性能优于现有方法,且计算复杂度显着降低,使其成为评估幻觉检测的高效且稳健的解决方案。