论文

集中强制:内容感知的每帧 KV 选择,实现高效自回归视频扩散

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

模型推理KV Cache

摘要

自回归视频扩散的最新进展使得顺序视频和流视频生成成为可能。然而,长范围生成需要越来越大的 KV 缓存,在不牺牲质量的情况下实现高效压缩具有挑战性。现有的方法大多根据注意力分数选择历史帧,但它们的上下文决策仍然很粗糙。当在同一块中生成多个帧时,这些方法通常对整个块应用共享历史选择,仅通过注意力对历史帧进行评分,并统一或通过注意力模式启发式分配头部预算,而不是明确的头部重要性估计。我们表明,同一生成块中的帧可以依赖于不同的历史帧,同一历史帧可以随着其与当前帧的相对时间距离的变化而获得不同的注意力分数,并且掩盖不同的头会导致不相等的生成退化。受这些发现的启发,我们提出了 \textbf{Focused Forcing},一种 无需训练 KV 选择方法,该方法将缓存的历史记录集中在生成的帧和头部维度上。对于每个生成的帧,聚焦强迫通过将注意力分数与历史帧的多样性分数相结合,保留最相关和最独特的历史帧,同时为具有更高估计重要性的头部分配更大的预算。在多种自回归生成范式中,聚焦强制无需训练即可实现高达 $\textbf{1.48}\times$ 的端到端加速,同时 \textbf{提高视觉质量和文本对齐}。 \textit{我们的代码将在 GitHub 上发布。}