论文
通过组合提示分解生成长文本到图像
Long-Text-to-Image Generation via Compositional Prompt Decomposition
摘要
虽然现代文本到图像 (T2I) 模型擅长根据复杂的提示生成图像,但当输入是描述性段落时,它们很难捕获关键细节。这种限制源于塑造训练分布的简短图像描述的盛行。现有方法试图通过长提示上的 微调 T2I 模型来弥补这一差距,这对于较长的长度来说推广性较差;或者将过大的输入投射到正常提示空间并损害保真度。我们提出了复杂场景建模的即时折射 (PRISM),这是一种组合方法,使预训练的 T2I 模型能够处理长序列输入。 PRISM 使用轻量级模块从长提示中提取成分表示。 T2I 模型对每个组件进行独立的噪声预测,并且使用基于能量的联合将它们的输出合并到单个去噪步骤中。我们在各种模型架构中评估 PRISM,显示出与在相同训练数据上微调的模型相当的性能。此外,PRISM 展示了卓越的泛化能力,在具有挑战性的公共基准测试中,提示超过 500 个词元,其性能比基准模型高出 7.4%。