论文
其中Pretraining写入和Alignment读取:Transformer权重空间的不对称性
Where Pretraining writes and Alignment reads: the asymmetry of Transformer weight space
摘要
交叉熵预训练和偏好对齐更新相同的 Transformer 权重,但留下几何上不同的痕迹。我们使用相对子空间分数探针来表征这种不对称性,该探针跟踪权重增量如何与残差流激活子空间以及由非嵌入定义的预测子空间对齐。对齐增量集中在读取路径($W_Q$,$W_K$)中,沿着注意输入激活的主要方向,同时在写入路径($W_O$,$W_2$)中相对于预测子空间保持接近各向同性。我们通过各向异性梯度累积来解释这种模式:对矩阵 $W$ 的更新是外积 $δ_t a_t^\top$ 的和,并从具有集中协方差的一侧继承方向结构。对于读取路径矩阵,这一侧是输入激活 $a_t$,其协方差在经过训练的 Transformer 中出现峰值,因此产生与目标无关的浓度。对于写路径矩阵,相关边是上游梯度$δ_t$,其各向异性取决于损失。交叉熵提供规范的尖锐每样本信号,在预训练期间诱导写入路径预测几何;对齐目标通常不会进一步增加写入侧集中度。我们通过检查点内轨迹、分级对比目标控制和具有匹配方向控制的封闭式 1 级干预来支持这一解释,为所提出的权重空间几何提供因果证据。