论文
PiD:利用像素扩散进行快速、高分辨率潜在解码
PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion
摘要
大多数实用的高分辨率文本到图像系统,包括潜在扩散和自回归模型,在紧凑的潜在空间中执行生成,并且解码器将生成的潜在空间映射回像素。然而,潜在像素解码器是面向重建的,经过优化以反转编码器而不是合成更多细节,并且在百万像素级别变得越来越昂贵。这个缺点需要更具表现力和更高效的解码范例。受可扩展像素空间扩散最新进展的推动,我们引入了 PiD,一种像素扩散解码器,它将潜在解码重新表述为条件像素扩散,将解码和上采样统一到一个生成模块中。通过直接在高分辨率像素空间中进行去噪,PiD 可以低延迟地合成 $4\times$ 甚至 $8\times$ 的放大图像。对于潜在调节,轻量级 sigma 感知适配器将噪声破坏的潜在数据注入像素扩散主干,使 PiD 能够解码部分去噪的潜在数据并提前终止潜在扩散过程。为了进一步提高效率,我们使用 DMD2 提炼模型,将推理减少到仅 4 个步骤。 PiD 适用于传统的 VAE 潜在模型和最近基于 RAE 的模型中使用的语义潜在模型(例如 SigLIP、DINOv2)。 PiD 在消费者 RTX 5090 上使用 13 GB 峰值内存,在 1 秒内将 512 × 512$ 图像的潜在图像解码为 2048 × 2048$ 像素,在 GB200 GPU 上最快可达 210 毫秒,比级联的基于扩散的超分辨率管道快约 6 倍,且具有更好的视觉保真度。