论文

PackForcing:短视频训练足以进行长视频采样和长上下文推理

PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference

模型推理KV Cache

摘要

自回归视频扩散模型已经取得了显着的进步,但它们仍然受到棘手的线性 KV 缓存增长、时间重复和长视频生成过程中的复合错误的瓶颈。为了应对这些挑战,我们提出了 PackForcing,这是一个统一的框架,通过新颖的三分区 KV 缓存策略有效管理生成历史。具体来说,我们将历史上下文分为三种不同的类型:(1)Sink tokens,它以全分辨率保留早期锚帧以维护全局语义; (2) Mid tokens,通过融合渐进 3D 卷积和低分辨率 VAE 重新编码的双分支网络实现大规模时空压缩(32 倍 token 减少); (3) 最近的标记,保持全分辨率以确保局部时间一致性。为了在不牺牲质量的情况下严格限制内存占用,我们为中间词元引入了动态 top-$k$ 上下文选择机制,再加上连续的时间 RoPE 调整,可以无缝地重新对齐由丢弃词元引起的位置间隙,而开销可以忽略不计。借助这种原则性的分层上下文压缩,PackForcing 可以在单个 H200 GPU 上以 16 FPS 生成连贯的 2 分钟、832x480 视频。它实现了仅 4 GB 的有界 KV 缓存,并实现了卓越的 24 倍时间外推(5 秒到 120 秒),可以有效地进行零样本操作或仅在 5 秒剪辑上进行训练。 VBench 上的大量结果证明了最先进的时间一致性(26.07)和动态程度(56.25),证明短视频监督足以进行高质量的长视频合成。 https://github.com/ShandaAI/PackForcing