Transformer 训练的光谱生命周期:瞬态压缩波、持续光谱梯度和 Q/K--V 不对称性
The Spectral Lifecycle of Transformer Training: Transient Compression Waves, Persistent Spectral Gradients, and the Q/K--V Asymmetry
摘要
我们提出了权重矩阵奇异值谱 \emph{Transformer 预训练期间的第一个系统研究,在三个模型尺度(30M--285M 参数)中以 25 步间隔跟踪每个权重矩阵的完整 SVD 分解。我们发现了三个现象: \textbf{(1)~瞬态压缩波:} 稳定的秩压缩作为行波从早期层传播到晚期层,产生了一个戏剧性的梯度,该梯度在早期达到峰值,然后 \emph{反转} - 晚期层最终过度压缩过去的早期层。 \textbf{(2)~持续光谱梯度:}幂律指数~$α$ 形成永久深度梯度,在更深的模型中形成非单调倒 U 形,随着深度的增加,峰值会向较早的层移动。 \textbf{(3)~Q/K--V 功能不对称:}值/输出投影均匀压缩,而查询/键投影则承载完全依赖于深度的动态。瞬态压缩和持久谱形状之间的分离揭示了\emph{秩和谱形状编码了根本不同的关于训练的信息}。我们将其形式化为两个时间尺度的动力学模型,并推导出尺度定律($Δα\propto L^{0.26}$,$R^2{=}0.99$)。我们在三个系列的九个模型(自定义、GPT-2、Pythia;30M--1B 参数;8--36 层)上进行验证,证明 $α$ 预测层重要性($ρ{=}0.69$--$0.84$,$p{<}0.02$),并表明谱引导剪枝优于 Last-N 启发式两个系列(GPT-2 124M--774M、Pythia 160M--1B)的七个模型的成本为 $1.1{\times}$--$3.6{\times}$,最差与最佳的差距高达 $23.7{\times}$,证实了光谱结构的因果作用。