用于自强制视频生成的 KV 缓存量化:33 种方法的实证研究
KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study
摘要
自动视频生成通过将生成的内容作为上下文重复反馈,将短视距视频模型扩展到更长的滚动生成时长。这种扩展路径立即暴露了系统瓶颈:键值 (KV) 缓存随着滚动生成长度的增加而增长,因此较长的视频不仅需要更好的生成质量,还需要更好的内存行为。我们对基于 Wan2.1 的 Self-Forcing 堆栈上的 self-forcing 视频生成的 KV 缓存压缩进行了全面的实证研究。我们的研究涵盖了 33 个量化和缓存策略变体、610 个提示级观察以及 63 个基准级摘要,涵盖两种评估设置:用于单次 10 秒生成的 MovieGen 和用于较长叙事风格稳定性的 StoryEval。我们共同评估峰值 VRAM、运行时间、实现的压缩比、VBench 成像质量、BF16 参考保真度(SSIM、LPIPS、PSNR)和终端漂移。三项发现是可靠的。首先,最强的实际操作区域是受 FlowCache 启发的软修剪 INT4 改编,它达到 5.42-5.49 倍的压缩率,同时将峰值 VRAM 从 19.28 GB 减少到约 11.7 GB,而运行时开销却很小。其次,最高保真度的压缩方法,尤其是 PRQ_INT4 和 QUAROT_KV_INT4,并不是最佳的部署选择,因为它们在严重的运行时或内存成本下保持质量。第三,仅名义压缩是不够的:几种方法缩小了 KV 存储,但仍然超过 BF16 峰值 VRAM,因为当前集成在关注和刷新阶段重建或保留了大型 BF16 缓冲区。其结果是一个基准测试工具、分析工作流程和经验图,其中 KV 缓存思想在当今是实用的,并且是更好的内存集成的有前途的研究方向。代码、数据产品和演示仪表板可在 https://github.com/suraj-ranganath/kv-quant-longhorizon/ 上获取。