论文

三相 Transformer

Three-Phase Transformer

模型架构Transformer

摘要

我们提出了三相 Transformer (3PT),这是标准 SwiGLU + RMSNorm + RoPE + GQA 主干上仅解码器 Transformer 的残余流结构先验。隐藏向量被划分为 N 个大小相等的循环通道,每个通道都由尊重相位的操作维护:每通道 RMSNorm、注意力和 FFN 之间的 2D Gives 旋转(按 theta + i*(2*pi/N) 旋转每个通道)以及将 GQA 头与分区对齐的头数约束。该架构是加扰和重新施加之间的自稳定平衡,而不是螺栓固定的模块。该分区划分出一个与通道正交的一维 DC 子空间,我们将固定的 Gabriel 喇叭轮廓 r(p) = 1/(p+1) 作为绝对位置侧通道注入其中,与 RoPE 的相对位置旋转正交。规范的 N=3 借用了平衡三相交流电的比喻,其中三个相距 120 度的正弦波之和为零,没有反相关对。在 WikiText-103 上的 123M 参数下,3PT 在 +1,536 个参数(总数的 0.00124%)的匹配 RoPE-Only 基线上实现了 -7.20% 的困惑度(-2.62% 位/字节),并具有 1.93 倍步数收敛加速(1.64 倍挂钟)。 N 表现为参数共享旋钮,而不是唯一的最佳值:在 5.5M 时,{1,2,3,4,6,8,12} 上的 N 扫描接近单调,N=1 获胜;在 123M 处,三种子扫描发现 N=3 和 N=1 在统计上无法区分。承载机制是通道分区的残余流、每块旋转、每相位归一化和喇叭直流注入。我们描述了(a)在没有明确执行的情况下几何的自稳定,这是神经网络守恒定律框架的一个新实例; (b) 12层旋转角漂移的U形深度剖面; (c) 与 RoPE、注意力和 FFN 的正交组合。