论文
DC-SAE:深度压缩语义自动编码器,可实现更快的扩散收敛
DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence
摘要
高压缩分词器对于扩展潜在图像生成模型至关重要。然而,激进的压缩在重建保真度和生成效率之间造成了根本性的权衡:高压缩图像编码器总是增加扩散训练的学习难度,导致模型收敛缓慢。最近的表示自动编码器通过用预训练的语义编码器替换 VAE 编码器来提高潜在特征的表达能力,从而加速扩散训练,但它们通常仅限于适度压缩并丢失忠实重建所需的像素级细节。为了实现高压缩和快速扩散训练,我们提出了 DC-SAE,一种解耦紧凑语义自动编码器,设计用于具有加速扩散模型收敛的高压缩图像生成。 DC-SAE 由两个关键组件组成:(1) 利用语义编码器实现更高压缩比的宏观架构设计,(2) 保留低级细节的像素级编码器,确保高保真图像重建。我们凭经验证明 DC-SAE 在图像生成任务上表现强劲,实现了紧凑的潜在表示和高效的训练动态。具体来说,在分辨率为 512×512的 ImageNet 数据集上,DC-SAE 实现了 32倍空间压缩,PSNR 为 29.79,gFID 为 3.37,在 PSNR 和 gFID 上大大优于之前最先进的高压缩分词器基线 DC-AE,分别提高了 13.5% 和 54.9%,保持了可比较的吞吐量和更快的扩散模型训练收敛。除了类条件生成之外,使用 DC-SAE 的 $1.6$B 参数 DiT 在 GenEval 上达到 0.84,在 DPG-Bench 上达到 86.007,以 $1024\times1024$ 分辨率生成文本到图像。