论文
Transformer 情境学习背后的独特机制
Distinct mechanisms underlying in-context learning in transformers
摘要
现代分布式网络,特别是 Transformer,获得了一种显着的能力(称为“上下文学习”),可以使其计算适应输入统计数据,从而使固定网络可以应用于来自广泛系统的数据。在这里,我们在 Transformer 上提供了在离散马尔可夫链的有限集 $S$ 上训练的这种行为的完整机制表征。 Transformer 显示了四个算法阶段,其特征是网络是否记忆和泛化,以及是否使用 1 点或 2 点统计。我们展示了这四个阶段是通过多层子电路实现的,这些子电路举例说明了用于实现上下文自适应计算的两种本质上不同的机制。最小模型分离了两个图案的关键特征。记忆和泛化阶段由两个取决于数据多样性的边界来划分,$K = |S|$。第一个 ($K_1^\ast$) 由子电路之间的动态竞争设置,第二个 ($K_2^\ast$) 由代表性瓶颈设置。 Transformer 训练动态的对称约束理论解释了从 1 点泛化到 2 点泛化的急剧转变,并确定了允许网络泛化的损失景观的关键特征。综上所述,我们表明 Transformer 开发出不同的子电路来实现上下文学习并识别有利于某些机制而不是其他机制的条件。