论文
KITE:用于高效代理 LLM 扩展的 KV 不变Transformer扩展
KITE: KV-Invariant Transformer Expansion for Efficient Agentic LLM Scaling
摘要
扩展语言模型不仅仅是最终质量的问题:架构选择决定了在训练、提示处理和自回归解码过程中花费多少计算来实现一定的模型质量。理想的模型架构应该降低所有上述计算成本,以便于扩展到更大的模型,同时确保更大的模型确实优于较小的基线。我们引入了 KV 不变Transformer扩展 (KITE),这是一种实现这一目标的扩展范例。它将模型从较小的尺寸训练到较大的尺寸(即通过升级来节省训练成本),同时将新添加的参数放置在不影响注意力KV的区域中。因此,在推理时,预填充KV仅依赖于模型的较小部分,从而节省了推理成本。作为一个具体实例,我们提出了 Step Scale Transformer (SST),这是一种双塔解码器,其中一个塔产生 KV,另一个塔读取它们。在可比较的累积训练计算中,SST(每个解码令牌具有 2.15B 活动主体参数的 67B MoE 模型)比分别具有 1.48B 和 2.02B 活动主体参数的 47B 和 63B MoE Transformer 实现了更低的训练损失,同时将估计推理成本降低了 6.7% 和 31.6%。