论文

FourierQK:查询键投影的频谱预处理提高了 Transformer 注意力

FourierQK: Spectral Preprocessing of Query-Key Projections Improves Transformer Attention

模型架构Transformer

摘要

基于 FFT 的学习查询键 (Q/K) 投影的频谱预处理大大提高了 Transformer 对字符级语言建模的注意力。在 TinyShakespeare 上:固定随机光谱滤波器实现 val=1.031 (Delta=+0.443);段落规模的单个学习频率达到 val=0.608 (Delta=+0.867);跨越段落到单词范围的四个学习频率达到 val=0.309 (Delta=+1.166),比标准点积注意力减少了 79%。单频结果在三个随机种子中得到确认(平均值 val=0.236,std=0.019)。四个频率收敛到与段落、子段落、短语和单词尺度相对应的近几何多尺度排序(49、27、10、6 个标记/周期)。该增益特定于频谱预处理:Q/K 的随机正交和非正交投影不会产生可测量的改进,这表明该增益来自全局频域混合而不是度量失真。所有结果均通过针对位置泄漏的混洗验证诊断进行验证。因果过滤器(Gaussian、Mexican Hat、Morlet)在字符级标记化方面并未改善标准注意力:双边 FFT 内核在结构上是非因果的,将每个位置与未来标记耦合。这定义了双边光谱注意力(本文)和字尺度标记化的真正因果光谱注意力(配套论文 MorletQK)之间的架构边界。这项工作在架构上与 FNet (Lee-Thorp et al., 2021) 不同,后者用词元嵌入的傅里叶混合取代了注意力。这里,谱预处理仅适用于 Q/K 投影,同时保留完整的注意力评分结构。