论文

具有紧凑词元压缩和线性注意力的高效一步扩散恢复模型

Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention

模型架构Transformer

摘要

现实世界图像超分辨率旨在从复杂且未知的现实世界退化中恢复高质量图像。然而,现有的生成式 Real-ISR 方法在很大程度上继承了为高分辨率图像合成而开发的密集潜在表示和二次成本全局建模范式,导致计算、内存使用和推理延迟随分辨率不利地扩展,从而限制了实际部署。我们认为,关键瓶颈不在于恢复先验不足,而在于高分辨率恢复期间过多的词元冗余和昂贵的词元交互。受这一观察的启发,我们从紧凑潜在表示和线性复杂度建模的角度重新审视 Real-ISR,并提出 SANA-SR,一种高效的一步恢复框架。具体来说,SANA-SR 采用具有 32 倍压缩比的深度压缩自动编码器,可大幅减少潜在标记,同时保留与恢复相关的结构和纹理。在这个紧凑的潜在空间之上,我们引入了带有 LoRA 微调 的线性注意力 DiT,通过线性复杂度词元混合实现高效的高分辨率恢复。对所有基准数据集的大量实验表明,SANA-SR 与现有方法相比,实现了极具竞争力且通常更优越的定量性能,同时恢复了更清晰、更真实的纹理。此外,经过剪枝后,部署模型的运行时间为0.019s,MAC数为407.95G,参数为344M,凸显了其在实际移动部署中的强大潜力。