论文

快速嵌入探针 (PEP):来自隐藏状态的 LLM 中的幻觉检测

Prompt Embedding Probes (PEP): Hallucination Detection in LLMs from Hidden States

模型评测评测方法与指标

摘要

大语言模型 (LLM) 可以产生流畅且有用的反应,但仍然容易产生幻觉。我们引入了提示嵌入探针(PEP),这是一种从冻结的 LLM 的隐藏状态中检测答案级幻觉的白盒方法。 PEP 通过使用少量可学习的提示嵌入来增强输入,从而扩展了标准线性探针。我们使用 Qwen3 模型在多个尺度上评估 TriviaQA、GSM8K 和 MedQA 上的 PEP。 PEP 改进了主要分布设置中标准线性探针的基于隐藏状态的检测。我们进一步评估 PEP 的预生成预测、跨模型迁移和分布外泛化。 PEP 在预生成和跨模型设置中仍然有效,但稳健的跨数据集传输仍然很困难。这些结果表明,基于提示的适应可以加强隐藏状态探测,同时保持骨干网冻结并仅添加少量可训练参数。