论文
作为协方差读数的自注意力:上下文学习和重复的统一视图
Self-Attention as a Covariance Readout: A Unified View of In-Context Learning and Repetition
摘要
大语言模型 (LLM) 表现出两种引人注目且表面上无关的行为:上下文学习 (ICL) 和重复生成。在这两种情况下,模型的行为就好像将上下文总结为人口级别的统计数据并丢弃了 词元级 细节。我们问这种“总结和遗忘”是否可以源自注意力机制本身,答案是肯定的。在平稳、遍历和椭圆输入下,softmax 注意力输出几乎肯定会收敛到 $θ_VΣθ_K^{\top}θ_Q x_t$,其中 $Σ$ 是输入协方差;因此,长上下文限制是输入二阶统计数据的线性读出。接下来有两个后果。 (i) 对于上下文线性回归,单个 softmax 头可以实现一步总体梯度下降。将此类头与残差连接堆叠起来迭代此更新并实现多个梯度下降步骤。 (ii) 通过 $L$ 层 Transformer 传播,该读数将参数 $1/t$ 速率的终端隐藏状态驱动为当前词元的确定性函数,以便自回归生成渐近崩溃为一阶马尔可夫链,其吸引轨道提供了重复和模式崩溃的结构说明。因此,这两种现象作为单一协方差读出原理的各个方面出现。