论文
外部观察者可能会看得更清楚:通过隐藏状态探测在大语言模型中进行跨模型跨级幻觉检测
External Observers May See More Clearly: Cross-Model Span-Level Hallucination Detection in Large Language Models via Hidden State Probing
摘要
随着大语言模型(LLM)越来越多地充当基础推理引擎,它们的幻觉倾向仍然是一个严重的漏洞。虽然最近的内部状态探测器为缓慢的外部检索系统提供了一种有前景的替代方案,但它们在很大程度上将幻觉检测简化为标记式二元分类任务,无法捕获语义漂移的结构化、连续边界。在这里,我们引入了一个用于细粒度、跨级幻觉检测的内部隐藏状态框架。通过检查分层激活模式,我们尝试检测 LLM 生成中确切的幻觉发作和持续标记。我们的实验表明,这种方法成功地隔离了幻觉发作,尽管存在极端的类别不平衡,但在随机基线上实现了精确召回 AUC 的显着提高。最终,我们提出了一种新颖的跨模型检测框架,其中一个模型观察另一个模型的生成所引发的内部表示。我们发现外部观察者可以匹配或超过生成器对其自身幻觉发作的自我检测,包括当观察者是较小模型时,这表明自我检测并不是发作定位的上限。