论文

UniCSG:通过分阶段语义和频率解缠统一高保真内容约束风格驱动生成

UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement

应用与实践内容创作

摘要

样式传输必须匹配目标样式,同时保留内容语义。基于 DiT 的扩散模型经常受到内容风格纠缠的影响,导致参考内容泄漏和不稳定的生成。我们提出了 UniCSG,这是一个统一框架,用于在文本引导和参考引导设置中进行内容受限、样式驱动的生成。 UniCSG 采用分阶段训练:(i) 潜在空间语义解缠阶段,将低频预处理与条件损坏相结合,以鼓励内容风格分离;(ii) 潜在空间频率感知细节重建阶段,通过多尺度频率监督细化细节。我们进一步结合像素空间奖励学习,使潜在目标与解码后的感知质量保持一致。实验证明了两种设置中内容 忠实性、风格对齐和稳健性的改进。