xHC:扩展的超连接
xHC: Expanded Hyper-Connections
摘要
超连接 (HC) 将 Transformer 的剩余流扩展为 $N$ 并行流,提供了一种超越模型宽度和深度的内存扩展形式。歧管约束 HC (mHC) 可大规模稳定该配方。从 $N{=}1$ 到 $N{=}4$ 的巨大收益表明残差流扩展是一个有前途的缩放轴。然而,现有的 HC 系列方法通常停在 $N{=}4$ 处。我们的实验揭示了原因:将 mHC 扩展至超过此点会导致性能增益逐渐减少,并且训练成本迅速增加。我们将此限制归因于两个瓶颈:对于数量不断增加的流而言回写信息不足,以及剩余混合生成,其成本与 $N$ 呈三次方缩放。为了解决这两个瓶颈,我们提出了 xHC(扩展超连接),这是第一个实现超过 $N{=}4$ 的有意义扩展的 HC 系列方法。 xHC 将时间特征增强与稀疏残差流架构相结合,以实现更丰富的回写,该架构仅更新 $N=16$ 流中的 $k=4$,同时保留对完整残差状态的密集访问。在 18B 和 28B MoE 型号中,xHC 提供了强大且一致的下游改进。在 18B MoE 模型上,xHC 将平均下游分数比 mHC 提高了 4.0 分,同时仅在普通基线上增加了适度的训练失败次数。缩放定律实验表明,vanilla 和 mHC 分别需要 xHC 的计算 $1.50\times$ 和 $1.19\times$ 才能达到相同的损失。实际的大$N$训练还需要控制扩展剩余状态的内存流量。因此,我们引入了 xHC-Flash,它将每子层内存流量从 $73.5C$ 降低到 $40C$,相当于 $N{=}4$ 时 mHC 所需的 $34C$,同时保留完整 xHC 的增益。 xHC 和 xHC-Flash 一起使 LLM 预训练 的大型剩余流扩展变得有效且实用。