论文

VARestorer:用于真实世界图像超分辨率的一步式 VAR 蒸馏

VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution

摘要

视觉自回归模型(VAR)的最新进展证明了它们在图像生成方面的有效性,突出了它们在现实世界图像超分辨率(Real-ISR)方面的潜力。然而,使 VAR 适应 ISR 面临着严峻的挑战。受因果注意力约束的下一尺度预测机制无法充分利用全局低质量(LQ)上下文,导致模糊且不一致的高质量(HQ)输出。此外,迭代预测中的错误累积严重降低了 ISR 任务的一致性。为了解决这些问题,我们提出了 VARestorer,这是一种简单而有效的 蒸馏 框架,可将预先训练的文本到图像 VAR 模型转换为一步 ISR 模型。通过利用分布匹配,我们的方法消除了迭代细化的需要,从而显着减少了错误传播和推理时间。此外,我们引入了具有跨尺度注意力的金字塔图像调节,它能够实现双向尺度交互,并在适应自回归机制的同时充分利用输入图像信息。这可以防止 Transformer 中忽略后来的 LQ 词元。通过微调,通过参数高效的适配器仅需要1.2%的模型参数,我们的方法保持了原始VAR模型的表达能力,同时显着提高了效率。大量实验表明,VARestorer 在 DIV2K 数据集上实现了最先进的性能,达到 72.32 MUSIQ 和 0.7669 CLIPIQA,同时与传统 VAR 推理相比,推理速度提高了 10 倍。