论文
UniCanvas:基于扩散的图像中文本联合生成统一模型
UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation
摘要
近年来,统一视觉语言模型在单一架构中处理多模态理解和生成方面取得了显着进展。虽然自回归 VLM 可以跨模态进行推理,但它们无法生成高质量的图像。相比之下,扩散模型可产生逼真的视觉效果,但难以生成连贯的文本,这使得开发能够无缝处理视觉和文本生成的单一统一模型具有挑战性。最近的进展表明,语言可以有效地嵌入到视觉表示中,从而允许模型直接从图像中推理文本语义。为此,我们提出了 UniCanvas,这是统一扩散模型以通过图像中文本生成来生成交错多模态内容的首次尝试。扩散模型自然地捕获共享像素画布上的变换,这可以被视为视觉变化的世界模型。该模型不是生成离散的文本标记,而是学习利用其固有的多模态嵌入空间将语言表示为图像内的视觉模式。这种设计允许模型在图像合成过程中在单个像素画布内自然地“绘制”文本,从而实现无缝的多模态生成。实验表明,UniCanvas 比以前的统一模型提高了性能,将使用扩散模型的图像中文本生成定位为有前途的统一多模态生成范例。