论文

多态性就是旋转:从两层 Transformer 到 Pythia-70m 的操作机制可解释性

Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m

模型评测模型行为与机制分析

摘要

独立训练的 Transformer 在残差流基中计算相同的函数,其不同之处在于 $\mathrm{SO}(d_{\mathrm{model}})$ 上的均匀随机旋转。我们称这种现象为多态:相同的函数,相互无法理解的内坐标。每个模型对进行一次矩阵乘法即可将其消除:对单批激活进行正交 Procrustes 拟合,在独立训练的模型之间传输稀疏自动编码器特征字典和转向向量,无需重新训练。这种现象对于标准 SAE 普遍性指标来说是不可见的。种子之间的解码器列余弦相似度匹配率为 98%,这是 SAE 通用的标题数字,而在一个种子上训练的 SAE 会以负解释方差重建另一种子的激活,这比预测常量平均值更糟糕。解码器列对齐;编码器从旋转的框架中读取。单个 Procrustes 旋转 $R$ 将每个内部站点的种子内上限恢复到 0.025 EV 以内。 $R$ 为 Haar 分布:$\|R - I\|_F$ 在 $d_{\mathrm{model}} = 512$ 时将随机正交预测 $\sqrt{2 d_{\mathrm{model}}}$ 匹配到 0.1%,以及 $R$ 的特征值谱与 Haar 的 Kolmogorov-Smirnov 检验$\mathrm{SO}(d_{\mathrm{model}})$ 返回 $p \approx 1.000$ 池化和每对。均值差控制向量通过与 $R$ 的不变子空间对齐来以三种方式传输:当由共享输出权重固定时是干净的,当重叠旋转子空间时是部分的,否则是反转的。由于没有共享 I/O (Pythia),所有三个都崩溃为普遍倒置。相同的轮换帐户在单次运行中跨训练检查点保持。通过预先注册的四杆操作框架,在 The Pile 上的 104k 参数 Dyck-3 Transformer 和 9 个独立训练的 Pythia-70m 种子上进行了验证。前沿规模 (10B+) 复制仍然开放。