论文

D-Score:大语言模型 中用于幻觉检测的光谱隐藏状态信号

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

模型评测评测方法与指标

摘要

大语言模型 可以生成错误的、不受可用证据支持或与模型内部表示的信息不一致的流畅文本。我们从隐藏激活的几何形状中研究幻觉检测,并引入 D-Score,这是一种通过单次前向传播计算得出的简单光谱统计数据。对于固定模型、层和容差参数,D-Score 计算隐藏激活矩阵的奇异方向有多少个奇异值与前导方向保持接近。我们使用这个数量作为幻觉分数,当输入文本的 D 分数大于预定义的数量时,将其分类为幻觉。动机是,当模型处理与其自身内部状态中可用信息相冲突的文本时,隐藏表示可能会对所断言的内容和某种形式的反证据、不确定性、纠正或缺乏支持进行编码;这可以使隐藏轨迹分布在额外的奇异方向上。我们通过轻量级光谱论证将这种直觉形式化,并在 FAVA-Annotation 和 RAGTruth 上评估所得检测器。实验表明,D-Score 是用于幻觉检测的强隐藏状态信号,同时不需要外部验证器、不需要检索步骤,也不需要多次生成。