论文
具有组合并行标记预测的可控图像生成
Controllable Image Generation with Composed Parallel Token Prediction
摘要
条件离散生成模型很难忠实地组成多个输入条件。为了解决这个问题,我们推导出了一个基于理论的公式,用于组成离散概率生成过程,其中掩模生成(吸收扩散)是一个特例。我们的公式能够精确指定训练数据之外的新颖组合和输入条件数量,并通过概念加权来强调或否定个别条件。与 VQ-VAE 和 VQ-GAN 丰富的组合学习词汇协同作用,与之前最先进的技术相比,我们的方法在 3 个数据集(位置 CLEVR、关系 CLEVR 和 FFHQ)上平均,错误率相对降低了 63.4%,同时获得了 -9.58的平均绝对 FID 改进。同时,我们的方法比同类方法提供了 2.3\times$ 到 $12\times$ 的实时加速,并且很容易应用于开放式预训练离散文本到图像模型,以对文本到图像生成进行细粒度控制。