论文

Transformer 平均场公式中训练引发的词元聚类逃逸

Training-Induced Escape from Token Clustering in a Mean-Field Formulation of Transformers

模型评测模型行为与机制分析

摘要

Transformer 通过跨层迭代转换标记表示来执行推理。这种分层计算已经过实证研究,最近的 Transformer 动力学平均场理论解释了注意力如何驱动词元分布走向聚类。然而,现有的平均场分析在很大程度上按照规定对待模型参数,而训练如何重塑这种聚类图景仍是未知数。我们在噪声平均场 Transformer 中研究这个问题,其中仅在 $L^2$ 正则化下训练参数线性 FFN。我们发现并分析了动态中训练引发的阶段:在最初遵循注意力驱动的聚类之后,词元分布可以使聚类状态接近最终层。我们的数学分析基于熵正则化的相互作用能量,它捕获了注意力的聚类偏差。更广泛地说,我们的结果指向 Transformer 动力学的训练感知平均场理论,其中训练和推理动力学被一起处理。