论文

文本到图像模型对文本编码器的需求比您想象的要少

Text-to-Image Models Need Less from Text Encoders Than You Think

模型评测模型行为与机制分析

摘要

文本到图像模型依赖文本提示作为人类意图的主要界面。文本编码器将提示编码为嵌入,以调节图像生成过程。除了单个标记含义之外,文本嵌入还对整个提示中的上下文信息进行编码,例如组合性和属性绑定。然而,图像模型是否真正利用了这些更丰富的信息仍有待探索。在这里,我们解决这个问题:文本表示的哪些方面对于图像生成至关重要?我们表明,基于 Transformer 的文本到图像扩散模型通常仅依赖于文本表示的两个相对简单的方面:(i)对于跨越多个标记的单词,将相邻标记合并到单词表示中,以及(ii)单词顺序,这是由文本编码器的位置嵌入所印记的。为了证明这一点,我们构建了一个新的文本嵌入,它仅对单个单词的含义和顺序进行编码,但缺乏有关完整提示的任何上下文信息。我们发现,这一包位置标记的单词表示足以成功指导图像生成,实现与全文嵌入引导生成相当的视觉质量和文本保真度。这表明,与普遍看法相反,文本到图像模型通常不使用文本嵌入中编码的超出单个单词含义和词序的丰富信息。相反,复杂语言结构的解码是由图像模型本身执行的。项目网页:https://nsping13.github.io/contextless-TTI/