论文

惊喜强迫:在长视频生成中要记住什么,何时跳过

Surprise Forcing: What to Remember, When to Skip in Long Video Generation

模型推理KV Cache

摘要

流式自回归扩散使分钟级视频合成变得实用,但其有界上下文和固定去噪时间表在高度非平稳的序列中均匀分配资源。滚动键值缓存会忘记远处的视觉证据,即使该证据仍然很重要,而每个生成的块都会接收相同数量的去噪通道,而不管其实际难度如何。我们引入 Surprise Forcing,这是一个 无需训练 框架,它将这两个限制视为在线资源分配问题。惊喜门控记忆库用价值词元描述符总结被逐出的帧,使用互补的全局偏差和最近邻新颖性信号对其进行评估,并通过标准化分数空间中的反馈控制预算来调节准入。基于优先级的替换和相关性感知路由可以保持外部存储器的紧凑和有用。同时,惊喜感知去噪根据第一次去噪后的最大相邻帧余弦距离估计块难度,并使用本地百分位数调度程序跳过相对简单的块的中间步骤。 VBench、VBench-Long 和 VBench-2.0 上的实验表明,所提出的分配策略提高了长视野一致性和视觉质量,同时保留了实时流吞吐量。