论文
Transformer 注意力中的缩放幂等性:配对 OV 几何和共享值代数
Scaled Idempotence in Transformer Attention: Paired OV Geometry and Shared-Value Algebras
摘要
我们在 Transformer 注意力中发现了一个循环代数规律:有效 OV 算子的稀疏子集 $T=OV^\top$ 在组合 $T^2\approxαT$ 下几乎闭合。在跨越 2.8B--235B 参数的六个预训练端点中,3.98--8.00% 的头达到平方闭合对齐 $\mathcal{P}\geq0.9$,而没有匹配的层内 O/V 不匹配。精确的主坐标分解 $T=Q_OKQ_V^\top$ 和 $T^2=Q_O(KDK)Q_V^\top$ 将支持内传输与读写返回几何图形分开。在 9 个 MHA/GQA 模型的所有 7,304 个头部中,仅对 $K$ 的方向进行置乱,同时保留奇异值、范数、因子跨度和主角,将中值闭合从 0.336 减少到 $1.04\times10^{-4}$; 98.64% 的头部和每一层都经过训练有素的定位获胜。建设性搜索表明,每个调查层的高度闭合都是可行的,但通常无法实现。三个独立训练的谱系的回顾轨迹进一步将广泛可用的能力与最终强大的头脑所达到的方向分开。在精确值共享下,头向闭包扩展到右动作代数 $T_iT_j=α_jT_i$。七模型实验验证了近似定律,并揭示了具有共享值定义内核的不同倾斜投影。这些结果将缩放幂等性描述为广泛可用的几何容量内的稀疏训练方向,并显示了价值共享如何将头向关系扩展到局部算子代数。