论文
MacTok:用于图像生成的鲁棒连续标记化
MacTok: Robust Continuous Tokenization for Image Generation
摘要
连续图像分词器可以实现高效的视觉生成,而基于变分框架的图像分词器可以通过 KL 正则化学习平滑、结构化的潜在表示。然而,当使用较少的标记时,这通常会导致后验崩溃,其中编码器无法将信息特征编码到压缩的潜在空间中。为了解决这个问题,我们引入了 \textbf{MacTok},这是一个 \textbf{M} 要求的 \textbf{A} 增强一维 \textbf{C} 连续 \textbf{Tok}enizer,它利用图像掩蔽和表示对齐来防止崩溃,同时学习紧凑和鲁棒的表示。 MacTok 应用随机掩蔽来规范潜在学习,并应用 DINO 引导的语义掩蔽来强调图像中的信息区域,迫使模型从不完整的视觉证据中编码强大的语义。结合全局和局部表示对齐,MacTok 在高度压缩的一维潜在空间中保留了丰富的判别信息,仅需要 64 或 128 个标记。在 ImageNet 上,MacTok 以 256$\times$256 分辨率下实现了具有竞争力的 gFID 1.44,并通过 SiT-XL 以 512$\times$512 分辨率下实现了最先进的 1.52,同时将词元使用量减少了高达 64$\times$。这些结果证实,掩蔽和语义引导共同防止后验崩溃并实现高效、高保真的标记化。