论文
通过中间结构预测分解主体驱动的图像生成
Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
摘要
主题驱动的文本到图像生成仍然难以保留高频身份细节,例如徽标、图案和文本。现有方法通常直接在 RGB 空间中操作,这通常会导致大量编辑下的细节退化。我们提出了一个两阶段框架,通过首先预测 Canny 图,然后根据源外观和预测结构渲染最终图像,将结构与外观分离。为了改进文本处理,我们进一步引入了一个全自动管道,该管道构建了具有跨视图文本一致性的 10 万对文本感知数据集。包括基于 GPT-4.1 的评估和 知识蒸馏 研究在内的实验显示出相对于选定基线的明显增益,并表明中间结构预测是高保真主题驱动生成的有效途径。我们的数据集和代码将公开。