论文
用于语义混合的文本嵌入的标记到标记对齐
Token-to-Token Alignment of Text Embeddings for Semantic Blending
摘要
在现代生成模型中,图像是通过文本提示指定和控制的。实际上,图像是根据从这些提示派生的标记序列生成的。然而,词元序列的空间缺乏一致的可访问结构:语义上相似的图像可能对应于概念的措辞、顺序和位置不同的序列,而相似的词元序列可能编码非常不同的语义。这种明显缺乏结构使得很难在该空间中执行平滑过渡,从而阻碍图像混合和连续编辑控制等应用。我们认为这种限制不是源于语义结构的缺失,而是源于表示之间的不一致。为了解决这种不一致问题,我们引入了词元到词元对齐,这是一个框架,可以在提示之间的词元之间建立明确的语义对应关系。我们的方法将提示转换为结构化表示,其中语义对应的概念被映射到提示中一致的位置,然后根据语义相似性对齐它们的标记嵌入。具体来说,该方法由两个阶段组成:将提示重新表述为共享结构化形式的结构对齐,然后是匹配跨提示的标记表示的嵌入级对齐。有了这种对齐,简单的线性插值就成为一种有意义的操作,产生平滑且连贯的语义转换,并支持混合和连续编辑等应用。我们的结果表明,文本到图像模型中的文本嵌入空间隐式编码了一个连续的语义结构,一旦表示正确对齐,该结构就变得可访问,这表明可以通过组织现有表示而不是修改生成模型来实现语义控制。