论文
聚焦与稀释:注意力的多阶段学习过程
Focus and Dilution: The Multi-stage Learning Process of Attention
摘要
基于 Transformer 的模型在广泛的领域取得了显着的成功,但我们对其训练动态的了解仍然有限。在这项工作中,我们确定了注意力学习中的循环焦点稀释循环,并通过梯度流分析在马尔可夫数据的一层 Transformer 设置中提供了严格的解释。使用围绕临界点的阶段式线性化,我们表明单个聚焦稀释循环可以分解为一系列不同的阶段。首先,嵌入和投影迅速压缩为一级结构,而注意力参数仍然有效地冻结。然后,注意力参数开始增加,引起频率驱动的焦点转向高频标记。随着注意力的不断发展,它会在嵌入中产生下一阶扰动,从而导致大规模重新分配机制,逐渐淡化这种焦点。最后,低频词元之间的微小不对称性会提升退化临界点,开辟新的嵌入方向并启动下一个周期。对合成马尔可夫数据以及 WikiText 和 TinyStories 的实验证实了预测的阶段和循环动态。