论文

HACK++:实现更有效的头部感知键值压缩以实现高效的视觉自回归建模

HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling

模型推理KV Cache

摘要

视觉自回归 (VAR) 模型采用下一代预测范例,以更少的解码步骤提供高质量的生成。然而,由于跨尺度的键值(KV)缓存的积累,现有的 VAR 模型面临着显着的注意力复杂性和严重的内存开销。在本文中,我们通过将 KV 缓存压缩引入下一个规模范式来应对这一挑战。我们从对 VAR 注意力的深入分析开始,观察到注意力头可以稳定地分为两个功能不同的类别:上下文头专注于保持语义一致性,而结构头则保持空间连贯性。它们的功能差异使得现有的一刀切的压缩方法在 VAR 模型上表现不佳。我们进一步发现,这两种头类型在对历史规模的依赖方面存在显着差异,并且这种依赖在层和生成步骤之间变化,从而支持自适应缓存预算分配。为了应对这些挑战,我们提出了 HACK++,这是一种用于 VAR 模型的 无需训练 Head-Aware 键值压缩框架。通过一次性离线校准,HACK++ 对头部类型进行分类并得出头部特定的先验。在推理时,它将注意力与独立预算下的缓存压缩解耦,限制当前规模的注意力成本,同时通过特定于模式的策略和依赖感知的预算分配更积极地压缩累积的缓存。对跨文本到图像、类条件以及统一理解和生成任务的多个 VAR 模型进行的广泛实验验证了 HACK++ 的有效性和通用性。例如,在 Infinity-2B/8B 上,HACK++ 仅用 30% 的注意力预算和 10% 的缓存预算即可保持近乎无损的生成,即使在 1% 的缓存预算下也能保持稳健。