论文
VOSR:图像超分辨率的纯视觉生成模型
VOSR: A Vision-Only Generative Model for Image Super-Resolution
摘要
最近的大多数生成图像超分辨率(SR)方法都依赖于适应在网络规模文本图像数据上预训练的大型文本到图像(T2I)扩散模型。尽管 SR 本质上是低分辨率 (LR) 输入条件图像恢复任务,但该范例虽然有效,但还是从通用 T2I 生成器开始。在这项工作中,我们研究了纯粹基于视觉数据训练的 SR 模型是否可以与基于 T2I 的模型相媲美。为此,我们提出了 VOSR,一个仅 Vision 的 SR 生成框架。我们首先使用预训练的视觉编码器作为视觉语义指导,从 LR 输入中提取语义丰富且基于空间的特征。然后,我们重新审视训练生成模型的无分类器指导,并表明标准无条件分支不适合从头开始训练的恢复模型。因此,我们将其替换为以恢复为导向的指导策略,以保留弱 LR 锚点。基于这些设计,我们首先从头开始训练多步 VOSR 模型,然后将其提炼为一步模型以进行高效推理。 VOSR 所需的训练成本不到基于 T2I 的代表性 SR 方法的十分之一,但在多步和一步设置中,它实现了有竞争力甚至更好的感知质量和效率,同时在合成和现实世界基准上产生更忠实的结构,减少幻觉。我们的结果首次表明,无需多模态预训练即可实现高质量的生成 SR。代码和模型可以在 https://github.com/cswry/VOSR 找到。