论文

当潜伏者忘记像素时:恢复扩散保真度 Transformer 超分辨率

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

应用与实践内容创作

摘要

使用大型生成模型的图像超分辨率 (SR) 最近取得了卓越的感知质量,但保持 LR 观察的保真度仍然具有挑战性。特别是,我们观察到建立在潜在表示基础上的扩散 Transformer (DiTs) 遇到了一个关键的限制:VAE 的压缩瓶颈削弱了细粒度的空间信息,导致输入图像中基础薄弱的幻觉细节。在这项工作中,我们从表示角度重新审视生成 SR,并提出了一种基于像素的超分辨率 (PGSR) 框架,该框架在 VAE 压缩之前保留 LR 观察到的像素证据,并在整个恢复过程中重复使用它。 PGSR 不是仅仅依赖于压缩的潜在条件,而是从上采样的 LR 图像中提取 VAE 前的像素证据,并在两个阶段重复使用它。首先,条件侧轨迹指导将 LR 导出的像素证据与潜在的 LR 条件融合,以指导潜在的恢复轨迹。其次,解码器端像素像素证据对齐将多尺度像素特征注入冻结的 VAE 解码器,以利用 LR 观察到的线索来像素证据对齐最终渲染。为了有效地适应大型预训练 DiT 模型,我们保持潜在自动编码器和主流匹配主干冻结,并仅训练轻量级恢复模块。我们进一步研究了一种有效的本地窗口注意力变体,以提高高分辨率效率和可扩展性。大量的实验表明,与现有的潜在生成 SR 方法相比,PGSR 改善了现实性和保真度权衡,并产生了更忠实、视觉上令人信服的结果。