论文
通过激活开放权重代理分析器进行幻觉检测
Hallucination Detection via Activations of Open-Weight Proxy Analyzers
摘要
我们引入了一个代理分析器框架来检测 大语言模型 中的幻觉。我们的系统不是查看生成模型的内部,而是通过本地托管的小型开放权重模型读取已经生成的文本,并使用读者自己的内部激活来发现幻觉。当生成器是像 GPT-4 这样的封闭 API 时,这与任何开放权重模型一样有效。我们基于 Transformer 处理文本的方式构建了 18 个特征,涵盖残差流规范、每头源文档注意力、熵、MLP 激活、logits 透镜轨迹和三个新的 词元级 基础统计数据。我们使用来自五个幻觉数据集的 72,135 个样本训练了一个堆叠集成。我们测试了七种分析器架构,涵盖 5 亿到 90 亿个参数:Qwen2.5 在 0.5B 和 7B,Gemma-2 在 2B 和 9B,Pythia 在 1.4B,LLaMA-3 在 3B 和 8B。在所有七个中,我们在 RAGTruth 上始终击败 ReDeEP 的 词元级 AUC 0.73 7.4 至 10.3 个百分点。 Qwen2.5-7B 的 F1 达到 0.717,略高于 ReDeEP 的 0.713,而 Qwen2.5-0.5B 达到 0.706。最引人注目的发现是所有 7 个模型的聚类程度如何:AUC 仅相差 2.3 个百分点,模型大小相差 18 倍。更令人惊讶的是,我们的 3B LLaMA 在 RAGTruth 上的表现优于我们的 8B LLaMA,这表明即使在同一型号系列中,越大并不总是越好。 RAGTruth 和 LLM-AggreFact 都包含来自多个 LLM 系列的输出,因此我们的结果不会偏向任何特定的生成器。