论文
STEDiff:强化文本嵌入以改善图像生成的语义对齐
STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model
摘要
尽管预训练的文本到图像(T2I)生成模型可以生成高质量的图像,但由于随机噪声和固有的模型限制,它们通常无法忠实地反映复杂提示的语义意图。此问题经常表现为模型忽略特定对象或无法将属性正确绑定到其相应的实体,这是一个称为语义对齐的挑战。与依赖计算昂贵的 微调 或劳动密集型布局先验的现有方法不同,我们提出了 STEDiff,这是一种 无需训练 方法,旨在直接增强文本嵌入空间内的语义表示。具体来说,我们引入了一种主要利用 [EOT] 标记来加强子句子的相关语义,然后替换原始提示中的相应标记的方法。此外,还结合了一种新颖的语义增强损失来强制空间约束,确保每个实体的语义精确地映射到各自的图像区域。 T2I-CompBench 上的广泛定量和定性评估表明,我们的方法显着提高了复杂场景中的语义一致性和生成完整性。