论文

大规模树结构前馈层的动态稀疏性

Dynamic sparsity in tree-structured feed-forward layers at scale

模型优化稀疏化

摘要

在典型的上下文长度下,前馈 MLP 块占 Transformer 计算预算的很大一部分,从而激发了对密集 MLP 块的稀疏替代方案。我们研究稀疏的树结构前馈层,作为深度 Transformer 架构中 MLP 块的直接替代品,从而无需单独的路由器网络即可通过硬分层路由进行条件计算。我们首次证明这种形式的树结构条件稀疏性可以应用于自回归语言建模和下游问答,包括零和少样本设置,及其超越 1B 参数的可扩展性。尽管每个词元激活的前馈块单位不到 5%,但我们的模型在受控训练和 微调 协议下匹配密集基线。我们进一步分析训练动态并识别出现的自动修剪效应:硬路由与不对称非线性的相互作用逐渐停用未使用的路径,从而将动态路由部分转换为静态结构稀疏性。我们证明,简单的架构选择可以调节这种行为并恢复平衡树而无需辅助损失。总的来说,我们的工作表明,树形结构的前馈层为稀疏大型 Transformer 模型提供了可扩展且可控的机制。