论文
TetherCache:通过门控召回和可信对齐稳定自回归长格式视频生成
TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment
摘要
自回归视频扩散模型通过在先前生成的内容上调节新生成的帧,为流式传输和可变长度视频生成提供了自然的公式。然而,将这些模型扩展到分钟级生成仍然具有挑战性:有限的 KV 缓存预算使模型无法保留完整的历史记录,而对自生成帧的反复调节会导致上下文分布变化,随着时间的推移而累积,导致视觉伪影、质量下降和时间漂移。在本文中,我们提出了 TetherCache,一种用于抗漂移长视频生成的 无需训练 和即插即用缓存管理策略。 TetherCache 将缓存组织为接收器、内存和最近区域,并引入了两种互补机制。首先,GRAB(具有注意力多样性平衡的门控回忆)使用门控分数来选择远程记忆帧,该门控分数将基于注意力的相关性与时间多样性相结合,在固定的缓存预算下保留信息丰富且多样化的历史背景。其次,TAME(通过内存编辑进行可信对齐)通过将统计数据与可信上下文分布对齐来对新调用的内存标记进行轻微编辑,从而减少历史特征漂移造成的污染。 TetherCache 基于 Self-Forcing 构建,在 30 秒、60 秒和 240 秒设置下持续提高 VBench-Long 上的长视频生成质量。特别是,对于 240s 一代,它显着提高了整体得分和语义得分,同时将质量漂移从 7.84 降低到 1.33,证明了其对稳定的长视界自回归视频扩散的有效性。