论文
SpecEdit:无需训练 通过语义锁定进行基于扩散的图像编辑加速
SpecEdit: Training-Free Acceleration for Diffusion based Image Editing via Semantic Locking
摘要
基于扩散的图像编辑提供了强大的语义可控性,但由于对所有空间标记进行迭代高分辨率去噪,计算成本仍然很高。动态分辨率采样通过以降低的分辨率执行早期步骤来降低此成本。然而,现有的方法优先使用低级启发式(例如边缘检测或通道方差)进行上采样,这与编辑语义的一致性较弱,可能导致结构不一致。此外,空间区域通常在没有验证是否确实需要语义修改的情况下进行上采样,从而导致冗余的高分辨率计算和累积误差。因此,我们提出了 SpecEdit,这是一个专为基于扩散的图像编辑而定制的 无需训练 动态分辨率框架。 SpecEdit 遵循草稿和验证方案:低分辨率草稿首先估计语义结果,然后使用 词元级 差异来识别与编辑相关的标记以进行高分辨率去噪,而其余标记保持粗略分辨率。 Qwen-Image-Edit 和 FLUX.1-Kontext-dev 上的实验展示了高达 10 倍和 7 倍的加速,同时保持了较高的质量。 SpecEdit 是对步骤 蒸馏 和其他加速技术的补充,与现有方法结合时可实现高达 13 倍的加速。我们的代码位于补充材料中,并将在 GitHub 上发布。