论文
IDEAL:深度对齐产生离散表示自动编码器
IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder
摘要
表示自动编码器 (RAE) 基于预训练的视觉基础模型 (VFM) 构建,最近已成为构建语义丰富的图像生成潜在空间的有前途的方法。然而,它们的重建质量通常仍然不够理想,这主要是因为深层 VFM 表示不能保留足够的细粒度视觉细节。离散化后,这种限制变得更加严重,丢失的底层信息很难恢复。事实上,我们观察到浅层 VFM 特征保留了相当丰富的局部外观和结构细节,这补充了现有 RAE 中使用的深层特征所携带的高级语义。受这种互补特性的启发,我们提出了 Ideal,一种用于离散表示自动编码的深度对齐框架。通过将量化标记与浅层和深层 VFM 特征联合对齐,Ideal 使生成的离散视觉标记能够保留视觉保真度和丰富的语义。大量实验表明,Ideal 具有卓越的重建性能,在 ImageNet 上实现了 0.61 rFID,比之前的最佳方法高出 0.28。当用于自回归图像生成时,Ideal 进一步产生 1.89 的 gFID,为自回归图像生成建立了新的技术水平。