论文
AffineTok:用于扩散友好的视觉分词器的语义仿射一致性
AffineTok: Semantic Affine Consistency for Diffusion-Friendly Visual Tokenizer
摘要
视觉标记器越来越多地将语义监督注入到潜在空间中,以使下游扩散更容易。然而,如何组织这些语义以促进去噪仍有待探索。在本文中,我们定义了语义恢复目标:去噪过程应该从噪声潜伏中恢复干净图像的语义内容,而一个好的分词器应该让它变得更容易。现有的方法训练投影仪直接从噪声潜伏中预测语义。我们认为这预测了干净图像语义的平均值,而真正需要对齐的是平均干净潜伏的语义。更重要的是,我们证明语义恢复误差直接从噪声潜伏和这两个预测之间的误差正交分解为最佳语义预测的误差。因此,我们将它们的一致性确定为缺失的要求,并将其称为语义仿射一致性(SAC)。为了检查这个被忽视的需求是否与下游生成密切相关,我们引入了 M_SAC,它是 SAC 的 tokenizer 端代理。在评估的分词器和扩散模型尺度上,M_SAC 密切跟踪生成质量,与 SiT-XL gFID 的 Pearson 相关性达到 0.960,从而激励 SAC 引导的分词器训练。然后我们介绍 AffineTok,它通过两个互补的、仅限训练的组件来促进 SAC。全局语义协调词元(GSCT)协调干净潜在变量的语义组织,保持语义平均有意义,而后均值语义对齐(PMSA)则从噪声输入中预测后均值潜在变量并监督其语义。在 ImageNet 256 上,与基线相比,AffineTok 在 20 个 epoch 时将 gFID 降低了 26%,并且通过持续训练,在无分类器指导的情况下达到了最先进的 gFID 1.21,在有指导的情况下达到 1.10。