论文

Transformer记忆的吸引子几何:从冲突仲裁到自信幻觉

Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination

模型评测模型行为与机制分析

摘要

语言模型利用两个知识源:权重中的事实(参数记忆,PM)和上下文中的信息(工作记忆,WM)。我们研究两种机制上不同的故障模式:冲突,PM 和 WM 意见不一致并相互干扰;当所询问的事实从未被了解时,就会产生幻觉。无论如何,两者都会产生自信的输出,从而使基于输出的监控在设计上变得盲目。我们证明这两种失败都有一个统一的几何解释。在自回归生成的隐藏状态空间中,学到的事实形成吸引子盆地。冲突是盆地竞争:WM 会扰乱向正确盆地的收敛,但不会提高输出熵。幻觉是盆地缺失:当不存在记忆盆地时,隐藏状态会自由漂移。为下一个令牌预测而设计的冻结 LM 头无法区分这些情况,并且无论哪种方式都会自信地触发。我们在受控合成任务实体标识符中验证此帐户,该标识符映射到通过 LoRA 适配器安装的 PM 的唯一代码,其中基本事实是准确的,并且可以通过有针对性的适配器放置来因果隔离组件角色。几何边距(隐藏状态到最近记忆盆地的距离)直接读取该几何形状,并比输出熵更清晰地将正确的回忆与幻觉分开,并且错误拒绝率为零,而基于熵的检测无法避免拒绝绝大多数正确的输出。这种分离保留了来自预训练模型的自然语言事实查询,无需进行任何调整,从而确认吸引子几何是结构性的,而不是微调工件。自信幻觉的比例遵循比例定律 $C = \exp(-c/\barΔ)$,即使总体错误率下降,也会随着比例而增长。隐藏状态可靠地编码认知状态;冻结的输出头会系统地擦除它——并且这种擦除会随着规模的扩大而恶化。

Transformer记忆的吸引子几何:从冲突仲裁到自信幻觉
图 2:最后生成步骤的示意性表示空间几何形状。内存仲裁(无论输出来自存储的权重还是输入上下文)都可以理解为模型表示空间中竞争吸引子的轨迹收敛。 (a) WM 条件作用会产生一个瞬态伪吸引子:一种向上下文一致状态的拉力,仅在这些上下文标记处于活动状态时才持续存在,这与在所有输入中持续存在的权重编码 PM 盆地不同。 (b) PM 盆地是持久的,以权重编码。 (c) 综合景观:PM 盆地轨迹收敛与 WM 偏转决定输出。 (d–f) 适配器扰动:QK 修改路由而不重塑盆地; VO 修改所选盆地内的读数; MLP重塑盆地结构。冲突是盆地竞争(PM和WM拉力都存在);幻觉是盆地缺失(隐藏状态徘徊在所有盆地之外)。