论文

HeadCast:吸引注意力以实现高效的自回归视频生成

HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation

模型推理KV Cache

摘要

自回归 (AR) 视频扩散模型已成为长视频和流视频合成的有前途的范例,但不断增长的键值 (KV) 缓存使注意力成为主要的推理成本,尤其是在高分辨率下,每帧贡献许多词元。现有的补救措施要么使用导致帧间闪烁的粗略启发法逐出缓存,要么需要模型重新训练。我们提出了 HeadCast,这是一种 无需训练 即插即用加速框架,基于对预训练 AR 模型的注意力头表现出稳定、异构行为的观察。经过短暂的预热后,HeadCast 在最大噪声步骤执行一次性分类,将每个头分类为四种原型之一:Sink、Dummy、Spatial 和 Global,并将整体 KV 缓存重组为特定于头的路径。至关重要的是,它保留了全局头部,以保持激进驱逐所破坏的长期时间一致性。由于 Spatial 路径在固定大小的网格上运行,因此其节省的成本随着分辨率的提高而增长:在最先进的 AR 模型中,HeadCast 在 720P 下将推理速度提高了 1.62 倍,在 1080P 下将推理速度提高了 1.95 倍,同时保持 VBench 质量与全神贯注的水平相当,并且基本不闪烁。代码可在 https://github.com/sjlgaga/HeadCast 获取。