论文
HalluSAE:通过稀疏自动编码器检测 大语言模型 中的幻觉
HalluSAE: Detecting Hallucinations in Large Language Models via Sparse Auto-Encoders
摘要
大语言模型(LLM)功能强大且被广泛采用,但其实际影响受到众所周知的幻觉现象的限制。虽然最近的幻觉检测方法取得了显着进展,但我们发现大多数方法都忽视了其动态性质和潜在机制。为了解决这一差距,我们提出了 HalluSAE,这是一种受相变启发的框架,它将幻觉建模为模型潜在动力学的关键转变。通过将生成过程建模为势能景观的轨迹,HalluSAE 识别关键过渡区域并将事实错误归因于特定的高能稀疏特征。我们的方法包括三个阶段:(1)通过稀疏自动编码器和几何势能度量进行势能赋能相区定位; (2)使用对比logits归因的幻觉相关稀疏特征归因; (3)通过线性探针对解开的特征进行基于探测的因果幻觉检测。 Gemma-2-9B 上的大量实验表明 HalluSAE 实现了最先进的幻觉检测性能。