论文
Transformer记忆的吸引子几何:从冲突仲裁到自信幻觉
Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination
摘要
语言模型利用两个知识源:权重中的事实(参数记忆,PM)和上下文中的信息(工作记忆,WM)。我们研究两种机制上不同的故障模式:冲突,PM 和 WM 意见不一致并相互干扰;当所询问的事实从未被了解时,就会产生幻觉。无论如何,两者都会产生自信的输出,从而使基于输出的监控在设计上变得盲目。我们证明这两种失败都有一个统一的几何解释。在自回归生成的隐藏状态空间中,学到的事实形成吸引子盆地。冲突是盆地竞争:WM 会扰乱向正确盆地的收敛,但不会提高输出熵。幻觉是盆地缺失:当不存在记忆盆地时,隐藏状态会自由漂移。为下一个令牌预测而设计的冻结 LM 头无法区分这些情况,并且无论哪种方式都会自信地触发。我们在受控合成任务实体标识符中验证此帐户,该标识符映射到通过 LoRA 适配器安装的 PM 的唯一代码,其中基本事实是准确的,并且可以通过有针对性的适配器放置来因果隔离组件角色。几何边距(隐藏状态到最近记忆盆地的距离)直接读取该几何形状,并比输出熵更清晰地将正确的回忆与幻觉分开,并且错误拒绝率为零,而基于熵的检测无法避免拒绝绝大多数正确的输出。这种分离保留了来自预训练模型的自然语言事实查询,无需进行任何调整,从而确认吸引子几何是结构性的,而不是微调工件。自信幻觉的比例遵循比例定律 $C = \exp(-c/\barΔ)$,即使总体错误率下降,也会随着比例而增长。隐藏状态可靠地编码认知状态;冻结的输出头会系统地擦除它——并且这种擦除会随着规模的扩大而恶化。
