论文
OmniCache:扩散模型的多维分层特征缓存
OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models
摘要
高分辨率图像和视频扩散模型,包括 SD3、FLUX 和最近的视频扩散 Transformer,极大地提高了生成质量,但在推理时仍然很昂贵,因为它们在许多采样步骤中重复评估高度关注的降噪器。我们通过利用中间扩散特征中的冗余而不是改变模型权重或重新训练来解决这种低效率问题。我们确定了图像和视频生成中的四个互补冗余源:帧内、帧间、运动和去噪步骤冗余。基于此分析,我们提出了 OmniCache,一个统一的分层缓存框架,通过 Token Cache、Frame Cache、Block Cache 和 Layered Cache 进行多维特征重用。与平均匹配特征的标记合并基线不同,OmniCache 使用相似性匹配来选择可缓存特征,跳过冗余计算,并恢复位置一致的缓存激活,从而保留特征顺序和时空结构。由此产生的框架重用了时间层中的空间特征和空间层中的时间特征,而分层缓存则在模型层级别捕获跨步骤冗余。在 SD3、SVD-XT 和 Latte 中,OmniCache 分别将推理延迟减少高达 35%、25% 和 28%,同时在 无需训练 设置中保持视觉保真度和运动连贯性。