论文
可变宽度 Transformer
Variable-Width Transformers
摘要
缩放模型大小,特别是深度和宽度,推动了基于 Transformer 的语言模型的重大进展。然而,大多数架构在所有层上保持恒定的宽度,均匀地分配固定参数和计算预算,尽管不同层可能扮演不同的计算角色。在这项工作中,我们通过提出 $\times$ 形 > <前架构,实证研究跨网络深度的非均匀容量分配。该设计利用无参数残余调整机制,保持更宽的早期层和晚期层,同时缩小中间层。在从 200M 到 2B 参数(密集)和 3B 参数(MoE)的纯解码器语言模型中,我们的 > <former 在语言建模损失方面始终优于参数匹配的统一基线。通过减少平均层宽度,该架构还需要更少的总体 FLOP(在拟合损失匹配缩放曲线下减少 22%)和更小的 KV 缓存和 I/O 成本(减少 15%)。在分析中,我们表明这种瓶颈结构导致残差流中的表示在质量上有所不同。总的来说,我们的结果表明,非均匀宽度分配可以导致语言模型的资源优化扩展。