论文
WhiteMatter:通过 KV 源混合实现全对全跨层连接
WhiteMatter: All-to-All Cross-Layer Connections via KV Source Mixing
摘要
生成文本时,Transformer 在每一层生成过去标记的表示,但每层通常只能使用相同深度的表示。此限制阻止模型完全重用其已计算的信息。我们引入了 WhiteMatter,它允许每一层从任何深度借鉴过去的词元表示。学习的混合器会为当前上下文选择最有用的深度,并将它们的表示组合到共享键值 (KV) 缓存通道中。跨层共享这些通道可以减少缓存大小。给定相同数量的训练词元,具有全尺寸缓存的 WhiteMatter 的性能与具有 50% 以上层数的标准 Transformer 相当。凭借一半的 KV 缓存,WhiteMatter 在两个模型尺度(高达 1.3B 参数)上优于匹配的标准 Transformer。然而,跨层连接会引入依赖性,从而减慢训练速度并促进处理。我们通过循环迭代来解决这个问题,它依次更新交错的词元组,同时并行处理每个组内的词元。在使用精确自回归执行训练的参考模型上,循环迭代的收敛速度比标准雅可比迭代快 12.5 倍。