论文

用于词元高效图像生成的语义感知前缀学习

Semantic-Aware Prefix Learning for Token-Efficient Image Generation

应用与实践内容创作

摘要

视觉分词器通过连接高维图像和易于处理的生成模型,在潜在图像生成中发挥着核心作用。然而,大多数现有的分词器仍然以重建为主的目标进行训练,这些目标通常会产生仅弱基于高级语义的潜在表示。最近的方法改进了语义对齐,但通常将语义信号视为辅助正则化,而不是使它们在功能上成为表示学习所必需的。我们提出了 SMAP,一种语义感知前缀分词器,它将类级语义条件注入到基于查询的一维分词框架中。为了使语义在训练过程中不可或缺,SMAP 引入了尾部词元丢弃策略,该策略迫使语义条件和早期潜在前缀在逐渐减少的 词元预算 下承担越来越大的责任。为了验证生成的潜在空间对于生成而不是单独重建有用,我们进一步引入了 CARD,一种混合​​因果自回归-扩散生成器。 ImageNet 上的大量实验表明,SMAP 在离散和连续标记化设置中持续提高了重建质量,并且其基于语义的潜在空间在紧凑的 词元预算 下产生了强大的下游生成性能。