论文

LLM 幻觉的几何分类法

A Geometric Taxonomy of Hallucinations in LLMs

模型评测评测方法与指标

摘要

大语言模型中的术语“幻觉”将不同的现象与嵌入空间中的不同几何特征混为一谈。我们提出了一种分类法,识别三种类型:不忠实(未能参与所提供的上下文)、虚构(发明语义上的外来内容)和事实错误(正确概念框架内的不正确主张)。我们观察到明显的不对称性。在 LLM 生成幻觉的标准基准上,检测是域本地的:域内 AUROC 0.76-0.99,但跨域为 0.50(机会级别)。域之间的判别方向近似正交(平均余弦相似度 -0.07)。在人为的虚构上——发明的机构、重新定义的术语、捏造的机制——单一的全局方向实现了 0.96 AUROC,跨域退化为 3.8%。我们对这种差异的解释如下:基准捕获了生成工件(提示制造的风格特征),而人为的虚构捕获了真正的主题漂移。由于基本现象不同,几何结构也不同。 III 类错误显示 0.478 AUROC - 与偶然无法区分。这反映了一个理论限制:嵌入编码分布共现,而不是与外部现实的对应。无论真值如何,具有相同上下文模式的语句都占据相似的嵌入区域。该贡献是一种几何分类法,阐明了基于嵌入的检测的范围:I 型和 II 型是可检测的;第三类需要外部验证机制。