论文
锥形语言模型
Tapered Language Models
摘要
现代语言模型,包括 Transformer、循环和基于内存的变体,共享一个共同的框架:一堆相同的层,其中参数在深度上统一分配。这是从原始 Transformer 继承的默认值,此后基本上没有变化,但越来越多的证据表明,各层对最终输出的贡献不均匀,后面的层会细化残余流而不是对其进行转换。我们询问参数容量是否应该反映这种不对称性。我们的对照实验表明,在固定预算下,为较早的层分配更多的容量,为较晚的层分配较少的容量,可以改善均匀宽度基线上的困惑,而反向分配则会造成伤害。在此结果的基础上,我们引入了锥形语言模型(TLM),这是一种架构原理,其中参数承载组件在固定的总预算下在深度上单调锥形。 MLP 是这种实例化的自然场所:它们在所有现代 LM 系列中主导参数计数,并将宽度暴露为单个、干净的变化轴。在三种模型规模和四种架构(Transformer、Gated Attention、Hope-attention 和 Titans)中,通过平滑余弦计划逐渐减小 MLP 宽度可以持续改善统一基线的困惑度和下游基准性能,而无需额外参数或计算成本。这些发现将深度感知的容量分配确立为语言模型设计的一个简单的、与体系结构无关的轴,一个隐藏在视线中的自由杠杆。