论文
未来强迫:用于自回归视频生成的未来感知 无需训练 KV 缓存策略
Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation
摘要
自回归 (AR) 视频生成已成为长视野视频合成的一种有前途的范例,其中每个帧都是根据先前生成的标记生成的。为了加速推理,KV 缓存用于避免跨生成步骤的冗余重新计算。然而,它随着生成长度的增长引入了内存和错误累积的增加,限制了 AR 模型的可扩展性,甚至更长的序列。现有的 KV 缓存压缩方法通过有选择地仅保留重要的视频词元来缓解此问题。然而,大多数现有方法使用从当前或历史生成上下文中派生的短范围信号来评估词元重要性,这使得这些方法容易忽略在早期步骤中显得不重要但后来对未来帧至关重要的词元。在这项工作中,我们确定了经过训练的 AR 视频模型的一个重要属性:尽管 RoPE 调制的查询在自回归步骤中不断演变,但底层规范的 RoPE 前查询分布在整个视频生成过程中保持非常稳定。这种近似平稳性意味着未来的查询分布可以根据历史统计数据进行估计,从而无需任何额外的训练即可实现有原则的未来感知缓存决策。基于这一见解,我们提出了 Future Forcing,这是一种用于 AR 视频生成的 无需训练 未来感知 KV 缓存策略。具体来说,未来强制首先根据历史统计数据构造一个未来查询代理,然后根据该代理下的重要性对 KV 缓存词元进行评分,最后在由未来查询引起的仿射子空间内合并冗余词元对。大量实验表明,Future Forcing 提高了有限 KV 缓存下的长视野一致性,与现有 AR 视频 KV 缓存策略相比,60 代 VBench-Long 上的主体一致性提高了 1.49。