论文
用于快速视觉字谜合成的结构-语义协同优化潜在扩散模型
Structure-Semantic Co-optimized Latent Diffusion Model for Fast Visual Anagram Synthesis
摘要
视觉字谜是一种有趣的艺术创作形式,其中单个图像在翻转或旋转等变换下呈现不同的概念解释。最近的工作通过利用预训练的文本到图像(T2I)扩散模型实现了视觉字谜合成,但仍然面临一些关键限制,包括计算效率低下、审美质量欠佳以及语义保真度和表达力较弱。这项工作的重点是以最小的计算成本生成视觉质量显着提高的视觉字谜,从而推进幻觉数字艺术的智能创作。为了提高图像分辨率,同时减少时间开销,我们将尖端的并行去噪算法从基于像素的 T2I 模型调整为基于对抗性蒸馏的潜在模型,并相应地提出了一种结构语义协同优化(S2CO)框架来抵消随之而来的视觉退化。作为我们方法的核心,S2CO 框架包含三个关键创新:(\romannumeral1) 空文本结构对齐优化; (\romannumeral2) 语义增强优化; (\romannumeral3)注意力引导的噪声融合。基于这些组件,我们称为 \textbf{S2CO-Anagram} 的方法能够生成更高分辨率的 anagram 图像,与相关的 SOTA 方法相比,该图像具有明显优越的视觉和谐和语义 忠实性,同时实现更快的推理速度。代码将公开。