论文
用于通过扩散进行高保真外观传输的 无需训练 框架 Transformer
A training-free framework for high-fidelity appearance transfer via diffusion transformers
摘要
Diffusion Transformer (DiTs) 擅长生成,但它们的全局自注意力使得可控的、基于参考图像的编辑成为一个独特的挑战。与 U-Net 不同,天真地将局部外观注入 DiT 可能会破坏其整体场景结构。我们通过提出第一个 无需训练 框架来解决这个问题,该框架专门用于驯服 DiT 以实现高保真外观传输。我们的核心是一个解开结构和外观的协同系统。我们利用高保真反演为源图像建立丰富的内容先验,捕获其照明和微纹理。然后,一种新颖的注意力共享机制在几何先验的指导下动态融合来自参考的纯化外观特征。我们的统一方法在 1024px 下运行,并且在从语义属性传输到细粒度材料应用等任务上优于专用方法。大量的实验证实了我们在结构保存和外观保真度方面的最先进的性能。