论文

用于高效自回归图像生成的头部感知键值压缩

Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation

模型推理KV Cache

摘要

自回归 (AR) 视觉生成已取得了显着的性能,但存在内存使用率高和吞吐量低的问题,因为它需要缓存先前生成的视觉标记。最近的研究表明,仅保留几行缓存词元就可以保持高质量的图像,同时显着减少内存使用并提高吞吐量。然而,这些方法为每个注意力头分配固定的预算,忽略了注意力头之间的异质性,导致内存分配不理想。在本文中,我们观察到不同层的注意力头表现出不同的注意力模式,其中一些头关注本地社区,而另一些头则捕获更广泛的上下文依赖性。基于这一见解,我们提出了一种用于自回归图像生成的新颖的头部感知键值(KV)缓存压缩框架,称为 HeadKV,它将较小的预算分配给局部偏向的头部,并将较大的预算分配给具有更广泛关注的头部。一个关键的挑战在于识别每个注意力头的类型以指导缓存压缩。我们进一步观察到,在同一层内,每个头在词元位置上表现出一致的注意力模式,\emph{即},头对早期词元的行为与对后期词元的行为保持一致。这一见解表明,可以在早期阶段识别头部类型,并在整个生成过程中重新用于 KV 压缩。它的优点是不需要额外的训练或数据集级别的统计数据,并且可以跨不同的输入无缝地概括。此外,我们设计了分层词元驱逐策略来有效保存远程信息。大量的实验证明了它在多个自回归图像生成模型中的有效性。