论文

GramSR:基于扩散的超分辨率的视觉特征调节

GramSR: Visual Feature Conditioning for Diffusion-Based Super-Resolution

模型训练监督微调与指令调优

摘要

尽管最近取得了进展,单图像超分辨率(SR)仍然具有挑战性,特别是在具有复杂退化的现实场景中。基于扩散的 SR 方法,特别是那些基于稳定扩散的方法,利用强大的生成先验,但通常依赖于从语义字幕派生的文本调节。这种文本描述仅提供高级语义,缺乏忠实恢复所需的空间对齐的视觉信息,导致抽象语义和空间对齐的视觉细节之间存在表示差距。为了解决这一限制,我们提出了 GramSR,这是一种基于扩散的单步 SR 框架,它使用预训练的 DINOv3 编码器从低分辨率输入中提取的密集视觉特征来代替文本调节。 GramSR采用三阶段LoRA架构,其中像素级、语义级和纹理级LoRA模块依次训练。像素级模块专注于使用 $\ell_2$ 损失来消除退化,语义级模块通过 LPIPS 和 CSD 损失增强感知细节,纹理级模块通过根据 DINOv3 特征计算的 Gram 矩阵损失来增强特征相关性一致性。在推理时,独立的引导尺度可以灵活地控制退化消除、语义增强和纹理保留。对标准 SR 基准的大量实验表明,GramSR 始终优于现有的基于单步扩散的方法,实现了卓越的结构保真度和纹理真实感。这项工作的代码位于:https://github.com/aimagelab/GramSR。