论文
Transformer 中的几何事实回忆
Geometric Factual Recall in Transformers
摘要
Transformer 语言模型如何记忆事实关联?一种常见的观点将内部权重矩阵视为嵌入对上的关联记忆,需要与事实数量线性缩放的参数计数。我们开发了一种替代的 \emph{geometric} 记忆形式的理论和经验解释,其中学习的嵌入直接编码关系结构,并且 MLP 发挥着本质上不同的作用。在单层 Transformer 必须记住从主题到共享属性集的随机双射的受控设置中,我们证明对数嵌入维度就足够了:主题嵌入编码其关联属性向量的 emph{线性叠加},并且小型 MLP 充当关系条件选择器,通过 ReLU 门提取相关属性,而不是作为关联键值映射。我们将这些结果扩展到多跳设置 - 关系查询链,例如“谁是 $x$ 的妻子的母亲?” - 提供有或没有思想链的结构,表现出可证明的容量深度权衡,并辅以匹配的信息论下界。根据经验,梯度下降会发现具有精确预测结构的解决方案。经过训练后,当主题嵌入被适当地重新初始化时,MLP 会将零样本转移到全新的双射,这表明它已经学会了通用选择机制,而不是记住任何特定的事实集。