论文

MultiHaluDet:通过 LLM 隐藏状态探测进行多语言幻觉检测

MultiHaluDet: Multilingual Hallucination Detection via LLM Hidden State Probing

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 中的幻觉是其可靠部署的关键障碍,这一漏洞在非英语和资源受限的环境中会严重加剧。依赖于输出置信启发式或单层内部表示的现有检测方法经常无法捕获不同语言之间深层、复杂的事实不一致之处。为了解决这个问题,我们引入了 MultiHaluDet,这是一种新颖的三阶段堆叠框架,它通过探测冻结 LLM 的完整隐藏状态轨迹来检测多语言幻觉,而不需要特定于语言的 微调。我们的方法提取多个层的顺序特征,并通过使用多尺度注意力和自注意力池的混合架构来处理它们。通过生成嵌入到校准的经典分类器集合中的折叠嵌入,MultiHaluDet 捕获了事实不一致的细粒度和粗粒度模式。大量实验表明,我们的框架实现了最先进的检测性能,使用 Mistral-7B 和 LLaMA2-7B 架构在英语 HaluEval 和 TriviaQA 基准测试中达到了高达 98.55% AUROC。至关重要的是,我们严格评估了我们的框架在高级语言(法语)、中级语言(孟加拉语)和低资源语言(阿姆哈拉语)中的跨语言泛化能力。 MultiHaluDet 表现出卓越的表征鲁棒性,始终优于基线,并成功地将幻觉检测能力转移到不同类型的语言层。