论文

FourierQK:滤波器形状、容许性和泄漏覆盖定律

FourierQK: Filter Shape, Admissibility and the Leakage-Coverage Law

模型架构Transformer

摘要

频率崩溃注意力 [Zeris,2026e] 通过在学习频率下用带通滤波内积替换 Q/K 点积,比标准点积注意力获得了更大的收益。一个自然的后续问题是:哪种滤波器形状效果最好,为什么?我们使用字符级语言模型(TinyShakespeare、6 层 GPT)上的受控消融来测试有关滤波器属性的五个假设——直流抑制、奈奎斯特抑制、带宽、中心频率和多尺度覆盖。我们的主要发现是:(1)直流和奈奎斯特分量是有害的(val ~= 2.0,相当于相位随机化),证实振荡带通结构是必不可少的,而不仅仅是任何低维频谱总结; (2) 最佳单尺度带宽是 sigma ~= 2 个以段落尺度为中心的 bin(~70 个标记),相对于 BASE-DOT 获得 Delta = +1.15 nat 的干净增益; (3) 容许滤波器(零均值,Mexican Hat DOG m = 2)在相同尺度下优于非容许高斯滤波器,并针对双边 FFT 泄漏提供部分保护; (4) 双边 FFT 泄漏与频谱覆盖范围单调变化——窄带滤波器(间隙 > +4)是干净的,宽带滤波器(间隙 < +2)是泄漏的; (5) 字符尺度上的因果时域 Morlet 无法击败 BASE-DOT(K=128 点覆盖了 T=256 上下文的 50%),激发了配套 MorletQK 论文中的单词级实验 [Zeris, 2026f]。总之,研究结果 (1)-(5) 表明 FourierQK 在双向注意力设置(编码器式,例如 BERT)中有效,其中全序列上下文在训练和推理时均可用;自回归生成需要因果谱变体,例如 MorletQK [Zeris, 2026f](解码器样式,例如 GPT)。代码位于:https://github.com/AthanasiosZeris/energy-gated-attention