论文
视觉定位探针:从观察者模型隐藏状态进行与生成器无关的幻觉检测
Grounding Probes: Generator-Independent Hallucination Detection from Observer Model Hidden States
摘要
检测检索增强生成不符合其上下文的响应会牺牲速度和准确性:表面检查会错过解释的制造,基于采样的方法会花费额外的生成。隐藏状态探针位于两者之间,但每个现有状态都会读取生成模型自己的激活,因此生成器的更改会使检测器失效,并且封闭权重生成器无法实现。本文消除了这种耦合。 Grounding 探针是对观察者语言模型的均值池中间层隐藏状态的逻辑回归,该模型在一次前向传递中读取上下文、问题和响应,并且不生成任何内容,其所需的配方是:池化响应token、读取中间层和控制容量,从而将训练测试 AUROC 差距从 0.087-0.202 缩小到 0.009-0.013。直接询问观察者,而不是读取其隐藏状态,在四个模型中的每一个中至少花费 +0.166 AUROC。拟合 15,090 个带注释的响应,在四个观察者的 RAGTruth 测试中达到 0.879-0.894 AUROC,并且使用监督跨度检测器平均 0.820 F1@0.5 达到 0.924 AUROC,比单独检测器高 0.060。一台探针可容纳 6 个发电机,而留出控件(包括训练中不出现评估提示的控件)将移除发电机的成本限制在约 0.02 AUROC。代码、探针和预测已发布。