论文
幻觉的现象学
The Phenomenology of Hallucinations
摘要
我们证明,语言模型产生幻觉并非因为未能检测到不确定性,而是因为未能把不确定性整合进输出生成。跨架构来看,不确定的输入都能被可靠识别,其所在区域的本征维度是事实输入的2-3倍。然而,这一内部信号与输出层的耦合很弱:不确定性迁移到低敏感子空间,在几何上被放大,在功能上却沉默。拓扑分析显示,不确定性表征发生碎片化,而非收敛到统一的弃答状态;梯度探针和Fisher探针则揭示出沿不确定性方向的敏感性塌缩。由于交叉熵训练没有为弃答提供吸引子,并一律奖励自信预测,联想机制会放大这些碎裂的激活,直到残余耦合迫使模型在内部已检测到不确定性的情况下仍给出一个确定的输出。因果干预证实了这一解释:当不确定性被直接连接到logits时,拒答行为得以恢复。
