论文
注意力平均场预测平均表示动态并揭示特定于上下文的计算
Attention Mean Fields Predict Average Representation Dynamics and Reveal Context-Specific Computation
摘要
语言模型的表示几何形状不是预先确定的;它随着模型的运行而演变。对几何形状的忠实描述必须捕捉动态过程,因此不能仅仅基于与模型无关的统计数据,例如共现。这里我们引入注意力的平均场分析。从一个词元到另一个词元的平均注意力定义了一个内核,该内核将表示层传递到层,并且可以通过网络进行迭代以对几何图形的转换方式进行建模。我们用两种方式来调节这个平均值。以整个语料库为条件,内核预测表示几何的平均情况演化。相反,它以单个上下文为条件,预测该上下文的预期几何形状。头部与该预测的偏离,即其 \emph{平均场偏差},隔离了平均场错过的特定于上下文的计算。在语料库条件读取下,内核产生一个开环模型:仅根据输入嵌入和冻结权重,我们可以在词元表示上迭代内核和模型自己的 MLP,而无需咨询任何层的测量偏差。由此产生的预测非常准确。在早期训练中,模型及其语料库平均场是无法区分的。将每个注意力头替换为其均值场,并且替换使真实文本的损失保持不变。在归纳开始时,两者出现分歧,并且随着表征变得情境化,差距扩大。在上下文条件阅读下,与平均场的偏差是上下文特定计算的与任务无关的度量。残差进一步分解为异常的注意力路由和传输值的情境化。在受控归纳和少样本设置中,更大的偏差表明对上下文信息的更大依赖。