论文
通过聚类截断提高自回归文本到图像生成中的样本多样性
Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation
摘要
虽然扩散模型在文本到图像(T2I)生成方面实现了最先进的图像质量,但最近的工作表明它们遭受了样本多样性崩溃的问题。在这项工作中,我们研究自回归 (AR) 图像生成模型是否可以推动图像质量和样本多样性之间的帕累托前沿。随着质量和效率的最新进步,AR 模型已成为基于扩散的图像生成的可行替代方案。除了支持交错图像文本生成等新用例之外,它们的顺序生成过程还使它们与最初为提高文本生成多样性而开发的各种基于词元的解码策略兼容。受到 AR 范式中更好的多样性与质量权衡潜力的激励,我们首次对 AR 图像生成模型中的样本多样性进行系统研究。我们证明了 AR 图像生成的两个关键属性,即持续高的 词元级 熵和视觉标记空间中的大量冗余,限制了现有 词元级 解码方法用于多样性增强的有效性。因此,我们提出 $p$-less 簇,这是一种新的解码策略,它在簇级别而不是 词元级 执行基于熵的截断采样。我们使用涵盖图像质量、提示对齐和多样性的一整套指标来评估四个自回归 T2I 模型和两个数据集的方法和基线解码方法。我们的结果表明,$p$-less 聚类在大多数评估的自回归 T2I 模型和数据集中释放了最大的多样性,同时保持图像质量和及时对齐。