论文
WNet:用于高效token混合的离散小波变换
WNet: Discrete Wavelets Transform for Efficient Token Mixing
摘要
在 Transformer 中,token混合是让每个token从其他token获取信息的步骤,并且它主导了编码长序列的成本。自注意力机制很好地实现了这种混合:每个token按内容对其他token进行权衡,从而提供了强大的上下文建模。这种全对比较也是其成本随着序列长度呈二次方增长的原因。我们引入了 WNet,一种 Transformer 编码器,它用基于离散小波变换 (DWT) 的token混合代替了自注意力。三个免注意力混合器重新组合音阶:通过线性融合、学习门控或让每个token选择其音阶。混合仅在最后一层添加自注意力。感受野分析表明,由二抽头滤波器(例如 Haar)构建的小波混频器永远不会在固定块之外关联token,无论网络有多深,即使滤波器是学习过的。较长的过滤器在两层内到达整个序列。我们使用具有大小匹配的 BERT 和 FNet 基线的受控设置以及无法混合token的控件,在 C4 的固定token子集和 GLUE 上的微调上使用掩码语言模型对每个模型进行预训练。 token门控混合器的训练速度与注意力一样快,为 256 token,速度为 2.7 倍,为 4,096。