论文
深度残差自注意力网络的通用插值
Universal interpolation for deep residual self-attention networks
摘要
通用逼近是学习架构从缩放定律中受益所必需的定性属性。虽然它通常在各种神经架构和随机特征模型上得到验证,但它通常涉及无限的宽度限制。在这项工作中,我们专注于深度自注意力模型,并考虑“对偶”机制,其中近似能力完全由深度实现,并具有强大的跨层参数共享功能,这受到了 Looped Transformers 等最新模型的推动。更具体地说,我们询问是否可以找到一组预定义的有限参数,每个参数定义一个注意块,以便生成的有限转换集可以将 $n$ 词元的 $N$ 序列的任何集合映射到 $n$ 词元的 $N$ 序列的任何其他集合。至关重要的是,这些转换是 固定且不依赖输入与输出 集合:仅应用块的顺序、它们的符号和持续时间取决于特定的插值任务。我们的主要结果仅使用两个具有高斯初始化投影矩阵的冻结单头块来建立残差 softmax 注意力。结果在连续深度和有限深度下均成立。我们还描述了因果屏蔽所施加的限制,并建立了相应的通用插值保证。