论文
不可压缩注意力下的可压缩 Softmax 参与语言
Compressible Softmax-Attended Language under Incompressible Attention
摘要
Softmax 注意力通过 $d_h$ 头部维度定义交互,但一旦真实文本通过,并非所有维度都具有相同的权重。我们将注意力 logits 字段分解为学习组件和生成组件,并分别测量它们的光谱。对于五个 Transformer 语言模型(124M--7B 参数,四个架构系列)中的所有 5,888 KV 头,logits 能量场 $\tilde{E}$ 在 2--11 个奇异分量中达到其方差的 90\%。学习到的交互矩阵 $W_Q^\mathrm{T} W_K$ 对于 $d_h \in {64, 128}$ 中的相同阈值需要 38--75 个分量。有效等级中的频谱差距为 5--25$\times$。 softmax 参与语言的可压缩性是数据的属性,而不是分析数据的框架。