论文

光谱离群值揭示了 Transformer 注意力中的主要学习结构

Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention

模型评测模型行为与机制分析

摘要

我们将 Marchenko-Pastur (MP) 随机矩阵理论应用于预先训练的注意力权重,以便将每个投影矩阵分离成类似随机的块和一组光谱异常值。我们按因果关系验证了这种分解:将 Mistral-7B 中 MP 识别的异常值(信号)归零可使 HellaSwag、MMLU 和 PIQA 接近随机机会性能,而将大量奇异值的计数匹配子集归零会导致较小但不可忽略的退化。在 11 个预训练的 Transformer 中,我们识别出五种重复出现的模式:光谱异常值编码学习结构的主要组成部分; Q 预测包含最多的异常值;分组查询注意力下的 V 投影缺乏清晰的信号/噪声分离;入门级异常值在 Q 中形成结构化行带,在 O 中形成列带;特定的残差流维度在 K 和 O 中作为跨层的带异常值持续存在。我们最后概述了这些观察结果如何为参数高效的 微调 和结构化剪枝提供信息。