论文
稀疏门控微型线性专家
Sparsely gated tiny linear experts
摘要
稀疏性允许在不成比例增加计算成本的情况下缩放模型参数。虽然专家混合 (MoE) 模型变得越来越稀疏,但个别专家通常仍然庞大且密集。在这里,我们证明,通过将每个专家缩小为由单个神经元组成并选择许多可用神经元中的一小部分来进一步增加稀疏性可以提高计算效率和可解释性。与直觉相反,实现这两个目标的关键是消除通常应用于专家的非线性,从而形成稀疏门控线性神经元(sgatlin)网络。在 isoflop 比较中,我们发现用 sgatlin 替换所有 Transformer 前馈层可以改善不同计算预算的语言模型的困惑度。与此同时,所得前馈电路的稀疏性和线性度为模型的可解释性提供了新的机会。在一个小规模的案例研究中,我们证明了 sgatlin 中的前馈电路可以被解释,而无需训练额外的替代模型。我们发现它们形成语义结构的集群,并且与事实回忆有因果关系。我们的研究结果描绘了一条通往计算高效且可解释的 Transformer 前馈层的可能路径。