论文
面向幻觉检测的自动层选择
Automatic Layer Selection for Hallucination Detection
摘要
近期关于幻觉检测的研究表明,与大语言模型(LLM)的最终层相比,幻觉相关信号在中间层中的编码更强。尽管越来越多的工作试图利用这一特性进行幻觉检测,但如何自动选择高性能层仍未得到充分探索,针对这一目的的原则性方法仍然缺乏。为填补这一空白,我们首先提出若干关于此类信号为何出现在中间层的假设,并在多种LLM架构、规模与任务上评估相应的自动层选择准则,覆盖问答与摘要两类幻觉检测基准。然而我们发现,这些准则没有一个能持续给出令人满意的性能。因此我们提出一种新的选择准则——内在维度的首个有效峰值(FEPoID),它能持续找到最优或接近最优的层,并且优于上述准则及现有幻觉检测基线。FEPoID无需训练,计算开销可忽略不计。此外,我们研究了LLM的生成行为,并提出一种简单而有效的截断策略,进一步放大幻觉相关信号,显著提升整体检测性能。代码已公开发布于 https://github.com/DesoloYw/Automatic-Layer-Selection-for-Hallucination-Detection.git