论文

DECK:LLM 幻觉的一致性 x 置信度分类法

DECK: A Consistency x Confidence Taxonomy of LLM Hallucinations

模型评测评测方法与指标

摘要

现有的幻觉分类法根据输出的错误对 LLM 错误进行分类——记忆的误解、推理失败、流畅的捏造——但无法回答另一个不同的问题:哪个不确定性评分者会发现这个错误?我们提出了一种补充分类法,通过可检测性特征(记分员家庭会读取的信号)对错误进行分类。 DECK 分类法是沿着样本间一致性和 词元级 置信度进行 2x2 划分,分为四种状态(漂移、根深蒂固、虚构、打结),产生可伪造的盲点图:黑盒一致性评分器在 D 和 C 中具有信号,白盒标记概率评分器在 K 和 C 中,并且只有一个 LLM 作为法官具有独立的预训练可以检测到 E。在三个模型和四个简短的 QA 数据集中,我们通过两种方式测试该图:涉及法官的记分员分歧集中在每个家庭的预测盲点单元格中,外部标签(SelfAware 无法回答、HaluEval 对抗性、PopQA 实体流行度)落在预测单元格中,稳健地交叉拟合阈值。我们进一步确定了输出级 UQ 的普遍盲点:在知识缺口输入上,生成器发出自信的、可重复的制造,每个输出级系列都会因构造而崩溃。尽管中间层保留了微弱的信号,但 Llama-3-8B 最后层隐藏状态上的线性探针无论有没有量化,也都是偶然的。