论文
Transformer注意力几何中的查询扩展与键专业化
Query Expansion and Key Specialization in Transformer Attention Geometry
摘要
查询和键的投影是 Transformer 架构中注意力机制的核心。虽然它们在数学上是对称的,但它们在注意力机制中发挥着不同的作用。他们的功能区别是否会影响他们在训练中的几何发展的问题仍然没有答案。我们通过在字符级 WikiText-103 上训练小型类似 GPT 的 Transformer 进行三个不同深度(4、6 和 8 层)、三种类型的查询和密钥初始化以及四个随机种子的训练来研究该问题,从而产生 36 次运行和跨种子平均层的 54 条轨迹。我们使用参与率跟踪这些层的有效维度,发现查询的有效维度扩大,而键收缩,并且 $PR_Q - PR_K$ 在所有研究的轨迹中都是正的。与注意力相关,键的缩小导致 $QK^\top$ 的频谱更窄,注意力权重更峰值。为了确定这种联系是因果关系还是巧合,我们在五个种子的训练过程中直接控制键的频谱:限制它以使其收缩,从而增强具有高方向置信度的注意力,同时将其保持在初始分散水平不变,从而使注意力变得更柔和。额外的标记级检查点分析表明,单调配对对比趋势在预训练家族中并不普遍,但作为一种早期训练制度存在,随后在完整的预训练运行中衰减,并且交互排名几何和注意力熵之间的联系在几个模型中仍然可见。