论文

固定状态,长距离:恒定大小的缓存如何购买大规模的块扩散

Fixed State, Long Reach: What a Constant-Size Cache Buys Block Diffusion at Scale

模型推理KV Cache

摘要

扩散语言模型并行解码标记,但它们的双向降噪器排除了快速自回归推理背后的朴素键值 (KV) 缓存。块扩散通过逐块解码来恢复缓存,到目前为止部署在其上的块缓存与注意力相关:内存中的 O(L),如果用作免训练改造,则仅是模型计算的近似值。这两个限制都可以克服:将最终块汇总为可重用状态的序列混合器支持块缓存,并且相应的块因果训练目标使缓存精确。我们大规模研究这一方法,在一个单前沿目标下对 300B 词元预训练三个 3B 块扩散降噪器(注意力、曼巴和混合),并通过单个缓存接口对所有三个进行解码。只有状态空间缓存的序列长度为 O(1):其内存和每步延迟在任何上下文长度下都保持不变,而注意力缓存则保持 O(L)。在 256k 词元(注意力已增长到 82GB 和 29 毫秒/步)时,Mamba 缓存的延迟降低了 4.3 倍,内存减少了 11 倍,单流吞吐量提高了 2.6 倍;而且由于该占用空间是恒定的,因此它也会随着批次的扩展而扩展,达到总吞吐量的 14 倍,其中注意力不能超出单个流。同样的线性状态偏差让 Mamba 和混合骨干网持续检索其训练长度的 8-16 倍,而注意力的检索则以 2 倍的速度崩溃,且没有测量质量成本。