论文
通过判别性文本表示将一步图像生成从类标签扩展到文本
Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation
摘要
少步生成一直是一个长期目标,最近以 MeanFlow 为代表的一步生成方法取得了显着的成果。现有的 MeanFlow 研究主要集中在类到图像的生成上。然而,一个直观但尚未探索的方向是将条件从固定的类标签扩展到灵活的文本输入,从而实现更丰富的内容创建。与有限的类别标签相比,文本条件对模型的理解能力提出了更大的挑战,需要将强大的文本编码器有效集成到MeanFlow框架中。令人惊讶的是,虽然合并文本条件看起来很简单,但我们发现使用传统训练策略集成强大的基于 LLM 的文本编码器会导致性能不令人满意。为了揭示根本原因,我们进行了详细的分析,结果发现,由于 MeanFlow 生成中的细化步骤数量极其有限,例如只有一步,因此文本特征表示需要具有足够高的辨别力。这也解释了为什么离散且易于区分的类特征在 MeanFlow 框架中表现良好。在这些见解的指导下,我们利用强大的基于 LLM 的文本编码器,该编码器经过验证具有所需的语义属性,并使 MeanFlow 生成过程适应该框架,从而首次实现高效的文本条件合成。此外,我们在广泛使用的扩散模型上验证了我们的方法,证明了生成性能的显着改进。我们希望这项工作为未来文本条件均值流生成的研究提供一般性和实用性的参考。该代码可从 https://github.com/AMAP-ML/EMF 获取。