论文
具有混合注意力的层的混合
Mixture of Layers with Hybrid Attention
摘要
标准专家混合 (MoE) Transformer 将词元路由到每层内的专家子网络,但层结构本身仍然是整体的。我们引入了混合层(MoL),它用降维的 K 个并行薄块(d_thin << d_model)取代全宽 Transformer 块(d_model),通过学习的向下/向上投影连接并通过 top-k 块路由组成。将稀疏块路由扩展到许多块会产生注意力覆盖问题,因为每个块看到的词元更少。我们通过引入混合注意力来解决这个问题,它将用于全局上下文的共享 softmax 块与路由块中的门控 DeltaNet 线性注意力配对。