论文
PixelDiT2:基于表示的像素扩散Transformer
PixelDiT2: Representation-Grounded Pixel Diffusion Transformers
摘要
像素空间扩散模型的最新进展缩小了与潜在空间扩散的图像质量差距,但收敛速度仍然较慢并且最终图像质量落后。我们认为一个关键原因是缺乏明确的先验表示:与通常在紧凑且结构化的潜在空间中进行降噪的潜在扩散不同,像素扩散需要从原始 RGB 空间同时学习降噪友好的表示和像素生成。为了解决这个问题,我们提出了 PixelDiT2,这是一种端到端的像素空间扩散模型,旨在将表示学习与像素生成解耦,而不引入自动编码器或潜在的重建瓶颈。我们提出表征对齐,它使用冻结的预训练视觉基础模型在整个去噪过程中提供明确的每块表示指导,从而允许像素扩散变换器更多地关注像素生成。在 ImageNet-256x256 上,PixelDiT2 在 600 个 epoch 后达到了 1.46 的 FID;在 512x512 分辨率下,PixelDiT2 在 680 个 epoch 后实现了 1.48 的 FID。