论文
MIMFlow:将掩模图像建模与标准化流程集成以生成端到端图像
MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation
摘要
归一化流 (NF) 是强大的生成模型,能够进行精确的密度估计和采样。然而,它们严格的可逆性常常迫使模型耗尽其在底层像素细节上的能力,从而阻碍了高级语义结构的捕获。虽然掩模图像建模(MIM)在表示学习方面表现出色,但它与生成管道的集成在很大程度上仍然是模块化和脱节的。在本文中,我们提出了 MIMFflow,这是一个统一的端到端框架,可以联合优化潜在语义、像素重建和生成流。通过采用 VAE 编码器从屏蔽图像中推断潜在语义,MIMFlow 实现了生成任务的原则性解耦:归一化流程专注于对简化的低频语义流形进行建模,而专门的解码器则处理高频合成。这种设计有效地解决了 NF 固有的容量瓶颈,使模型能够优先考虑全局结构一致性而不是冗余噪声。 ImageNet 256$\times$256 上的经验结果表明,MIMFlow-L 达到 71.3\% 线性探测精度,FID 为 2.50。尽管仅使用 128 个词元(比标准模型少 50%),但与类似规模的 NF 基线相比,它的性能提升了 32.8%。我们的代码可在 https://github.com/MCG-NJU/MIMFlow 获取。