论文
UniVL:用于空间空间对齐上下文图像生成的统一视觉语言嵌入
UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation
摘要
我们引入了基于空间的上下文图像生成,这是一种重构条件范式的可控图像生成任务。 UniVL 不是通过两个单独的编码器(一个用于视觉,一个用于语言)提供参考图像和全局文本提示,而是经过训练将语义直接从单个统一视觉输入绑定到空间位置,其中文本指令被渲染到空间掩模上。这消除了在推理时对独立文本编码器的需要。生成的模型通过遵循用户指定的关于什么应该出现在哪里的指令来支持上下文图像生成,同时大大减少计算。为了解决这一任务,我们提出了一个框架,其中 UniVL 编码器改编自光学字符识别预训练主干,以光学方式读取统一条件并生成 UniVL 嵌入 fVIL,它将视觉和语义意图与单个标记序列中的空间位置融合在一起。两级管道首先将 UniVL 与 VAE 嵌入空间对齐,然后完全在 UniVL 嵌入上调节预训练的扩散主干,从而消除独立的文本编码器,例如 T5。尽管这种重构使用了故意最小化的文本界面,但它产生了强大的经验收益。在 UniVL-ImgGen(我们为训练和评估构建的 477K 掩模注释图像基准)上,UniVL 提高了文本提示基线的图像质量,将 FID 从 14 减少到 11,将 PSNR 从 16 增加到 20。它还完全消除了文本编码器,将推理 TFLOP 减少了高达 52%,运行时间减少了高达 44%。额外的消融研究验证了所提出的组件的贡献,为使用统一的条件范式生成高效的、基于空间的图像铺平了道路。