论文
SPAE:用于预训练视觉潜伏的光谱引导自动编码器
SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents
摘要
视觉基础模型 (VFM) 的潜在语义丰富,非常适合视觉理解。最近的表示自动编码器方法(例如 RAE)已表明它们可以为图像生成提供有前途的潜在空间。然而,VFM 潜伏仍然难以直接建模:DiT 生成的潜伏表现出与编码器潜伏的频谱不匹配,特别是在高频分量中。我们的通道频谱分析进一步表明,这些高频分量广泛分布在潜在通道中,并与语义信息纠缠在一起,使得 DiT 难以对潜在空间进行建模。为了应对这些挑战,我们提出了 SPAE,潜在适应框架。具体来说,SPAE 采用紧凑的瓶颈来提取稳定的语义信息,同时抑制高频分量,从而改善 DiT 生成的潜在变量和编码器潜在变量之间的对齐。此外,我们应用通道级掩蔽策略来促进跨瓶颈通道的语义信息和高频细节的解耦。实验表明,SPAE 在视觉理解、生成质量和重建保真度之间取得了良好的平衡。