论文

L2P:释放像素生成的潜在潜力

L2P: Unlocking Latent Potential for Pixel Generation

模型训练参数高效训练

摘要

像素扩散模型最近重新受到视觉生成的关注。然而,从头开始训练高级像素空间模型需要大量的计算和数据资源。为了解决这个问题,我们提出了潜在到像素(L2P)传输范例,这是一种有效的框架,可以直接利用预先训练的 LDM 的丰富知识来构建强大的像素空间模型。具体来说,L2P 放弃了 VAE,转而采用大补丁标记化,并冻结源 LDM 的中间层,专门训练浅层来学习潜在到像素的转换。通过利用 LDM 生成的合成图像作为唯一的训练语料库,L2P 适合已经平滑的数据流形,从而能够在零实际数据收集的情况下实现快速收敛。该策略允许 L2P 仅使用 8 个 GPU 将大量潜在先验无缝迁移到像素空间。此外,消除 VAE 内存瓶颈可以解锁原生 4K 超高分辨率生成。跨主流 LDM 架构的大量实验表明,L2P 产生的训练开销可以忽略不计,但在 DPG-Bench 上的性能与源 LDM 相当,并在 GenEval 上达到 93% 的性能。