论文
大规模隐藏解码:大语言模型 的潜在计算扩展
Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
摘要
扩展 大语言模型 (LLM) 主要是通过扩大 Transformer 主干来驱动的,但对于已经很强大的模型,这需要另一轮昂贵的预训练。我们研究现有的主干是否可以通过为每个词元分配更多的计算来不断改进,同时保持 Transformer 主干固定。深度循环(循环)Transformer 追求这一目标,但很难扩展,因为循环计算并不自然地适合用于训练最大模型的管道并行性。我们沿着序列长度维度添加计算,其中额外的计算只是更长的输入,并与标准大 模型训练 保持兼容。我们提出了隐藏解码,这是一种在持续预训练(CPT)期间应用的序列长度缩放方法。它将每个词元扩展为具有独立嵌入表的 n 个流,并将中间流的键值缓存保留为上下文,因此每个词元执行更多内部计算,而无需添加或扩大 Transformer 层。为了在规模上保持这种负担得起,我们引入了流因子化注意力(Stream-Factorized Attention),其中大多数层仅参与每个流内,只有少数层跨流混合,从而将注意力成本从 n 的二次方降低到大致线性。实验支持两种缩放结果。在前沿规模上,我们在 n=4 下训练 WeLM-HD4-80B 和 WeLM-HD4-617B 并改进它们匹配的非 HD 基线,使隐藏解码成为第一个在 100B+ MoE 规模上演示的序列长度缩放方法。在扩展因子中,增益随着 n 的增加而增长,表明序列长度扩展是前沿规模 LLM 的实用固定主干扩展路径。