DeCoPrune:通过去噪一致性实现自回归视频扩散的高效 KV 缓存修剪
DeCoPrune: Efficient KV-Cache Pruning for Autoregressive Video Diffusion via Denoising Consistency
摘要
自回归视频扩散支持流式生成和交互控制,但其KV缓存随着生成的历史记录而增长。现有的压缩策略使用固定窗口丢弃历史记录,或通过局部注意力和相似性信号选择标记,而不直接测量块是否贡献超出保留上下文的信息。我们引入 DeCoPrune,这是一种免训练方法,将缓存压缩视为去噪一致性问题。我们发现,中间干净预测和最终去噪值之间差异较大的标记往往会携带从保留的上下文中难以预测的视觉证据。 DeCoPrune 使用此模型固有信号在长期缓存中保留高差异词元,同时修剪低差异词元。为了评估信息保留,我们引入了 CMBench,其中包括 58 个大约一分钟生成的或现实世界的上下文情节和 116 个需要回忆早期事件或对象的重新出现或重新访问连续任务。 LingBot World v2 的实验表明,DeCoPrune 在 0-1 等级上获得了 0.6701 的 DINO 分数,累计历史 KV 词元数量减少了 85.43%,连续生成速度比 FullKV 提高了 4.14 倍。其头部专用变体以 86.19% 的剪枝率达到 0.6783,接近 FullKV 的 0.6803 分数,并超过类似预算下评估的压缩基线。这些结果表明,去噪一致性可以支持远程信息保留,同时降低自回归推理成本。我们的项目主页是 https://decoprune.github.io. 代码可在 https://github.com/DeCoPrune/CMBench, 获取,基准测试可在 https://huggingface.co/datasets/Aoraku/CMBench. 获取