论文

大语言模型 中的可扩展 词元级 幻觉检测

Scalable Token-Level Hallucination Detection in Large Language Models

模型训练合成数据

摘要

大语言模型(LLM)表现出了非凡的能力,但他们仍然经常产生幻觉。这些幻觉在推理密集型任务中很难被发现,这些任务的内容看似连贯,但包含逻辑缺陷和不可靠的中间结果等错误。虽然步骤级分析通常用于检测内部幻觉,但由于其依赖于步骤分段,因此其粒度有限且可扩展性差。为了解决这些限制,我们提出了 TokenHD,这是一个用于训练 词元级 幻觉检测器的整体管道。具体来说,TokenHD 由一个可扩展的数据引擎组成,用于合成大规模幻觉注释,以及一个训练配方,该训练配方具有稳健的 模型训练 的重要性加权策略。为了系统地评估检测性能,我们还提供了严格的评估协议。通过 TokenHD 内的训练,我们的检测器直接对自由格式的文本进行操作来识别幻觉,从而无需预定义的步骤分段或额外的文本重新格式化。我们的实验表明,即使是小型检测器 (0.6B) 在训练后也能实现显着的性能提升,超越更大的推理模型(例如 QwQ-32B),并且检测性能随着模型大小从 0.6B 到 8B 一致扩展。最后,我们表明我们的检测器可以在不同的实际场景中很好地泛化,并探索进一步增强其跨域泛化能力的策略。