内在交互几何控制 Softmax Attention 的低秩复杂性
Intrinsic Interaction Geometry Controls the Low-Rank Complexity of Softmax Attention
摘要
需要多少矩阵秩才能保留归一化 Softmax 注意力的每个有界值输出?我们研究无限制的最大行\(\ell_1\)近似秩\(r_\varepsilon(A)\),它是在所有有界向量值上实现统一误差的最小秩。行 softmax 揭示了内在相互作用 \(C=P_m(\log A)P_N\),而可逆 \(Q/K\) 量规在更改所选查询/关键分解的欧几里德几何时保持 \(A\) 固定。我们用投影残差 \(q(C-T)\) 和获得的因子半径大小 \(κ(T)\) 替换依赖于坐标的描述。对于每个rank-\(r\)保留与\(τ(T)<\varepsilon\)的相互作用,我们证明$$ r_\varepsilon(A)\le \min\left\{ N,\; C_r\left( 1+\frac{κ(T)} {(\varepsilon-τ(T))^2} \right)^{r/2} \right\}, $$ 与底层加权吉布斯行覆盖具有相同的未知维度常数。该轮廓是规范不变的,按术语来说不比相同声明维度的本机保留子空间边界差,并且在固定的 \(r\) 和 \(\varepsilon\) 处具有最坏情况的尖锐 \(r/2\) 大小指数。然后,我们使用跨 BERT、GPT-2、Qwen2.5 和两个 ViT 检查点的 9,978 个认证支架直接测量学习注意力;如果证书没有关闭,则最优值仍然是区间值。一项预先指定的 2,302 个单元保留研究进一步表明,历史本机坐标几何块包含粗略的、主要是头部级别的信息,但没有超出强校准基线的可检测增量信息。该研究中没有评估新的内在描述符。总之,理论和测量将操作员固有的复杂性控制与学习头脑证据不支持的更强的经验解释区分开来。