论文

通过定向分解解开 Transformer 中的表示演化

Disentangling Representation Evolution in Transformers through Directional Decomposition

模型评测模型行为与机制分析

摘要

Transformer 表示通过学习的加法变换来演变,这些变换要么保留其当前方向,要么对其进行重定向。我们将这种演化作为函数几何来研究,将学习到的更新分解为平行和垂直分量。在预训练模型中,我们发现了超出剩余身份路径的大量并行组件。然后,我们在两个空间中应用分解:相对于隐藏状态的注意力和 MLP 更新,以及相对于当前标记值的注意力值聚合。有针对性的编辑揭示了强烈的空间依赖性不对称性:排除自我值空间并行操作明显比剩余空间和垂直对应操作更稳健,保留了直接的自我消息,同时仅缩放非自我聚合。相同的分解给出了压缩引起的更新误差的分量解析描述:垂直误差比并行误差更清楚地分离压缩方法。大量实验进一步证明,从头开始预训练期间的全聚合并行抑制降低了验证损失轨迹并提高了下游平均值,其中值空间变体最强。总之,这些结果将表示几何与编辑鲁棒性、压缩诊断和训练时干预联系起来。代码可在\href{https://github.com/Shwai-He/Transformer-Geometry}{项目存储库}中找到。