论文

超越几步推理:通过请求间缓存重用加速视频扩散 Transformer 模型服务

Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse

模型推理推理加速

摘要

视频扩散 Transformer (DiT) 模型是高质量视频生成的主要方法,但由于迭代去噪而导致推理成本较高。现有的缓存方法主要利用单个请求的扩散过程中的相似性来跳过冗余的去噪步骤。在本文中,我们介绍了 Chorus,这是一种利用请求之间的相似性来加速视频传播模型服务的缓存方法。 Chorus 在工业 4 步蒸馏模型上实现了高达 45% 的加速,而先前的请求内缓存方法在该模型中无效。特别是,Chorus 在去噪过程中采用了三阶段缓存策略。第 1 阶段对类似请求中的潜在功能进行完全重用。第 2 阶段在中间去噪步骤期间利用特定潜在区域中的请求间缓存。该阶段与词元引导注意力放大相结合,以改善生成的视频和条件提示之间的语义对齐,从而将完全重用的适用性扩展到后续的去噪步骤。