论文

正确的潜空间中的超分辨率:冷冻视觉基础基底

Super-Resolution in The Right Latent Space: A Frozen Vision-Foundation Substrate

应用与实践视觉感知与空间理解

摘要

在图像潜空间中,高分辨率、自然且清晰的图像的嵌入形成了流形。高分辨率图像的退化将它们的嵌入推离了这个流形。然后,现实世界的超分辨率(SR)成为将降级嵌入映射回流形上的任务——不是流形上的任何地方,而是保留输入仍然携带的内容,包括其语义和像素细节。每个已发布的方法都在面向重建的潜空间或像素空间中实现此映射。我们声称这些空间对于 SR 来说是错误的基底。低分辨率和降级图像嵌入远离流形,使得映射变得困难且昂贵。这些基底中缺乏语义信息也使得很难导航到流形上的忠实点,当退化严重时会导致严重的幻觉。因此,在合适的潜空间中恢复对于 SR 任务至关重要。我们证明了冷冻 DINOv3-L 的 23 个融合层的潜空间就是这样一个空间,它使 SR 任务变得更容易。退化图像嵌入在流形附近。此外,该基底包含从像素记录到退化鲁棒语义的信息层次结构,指导模型找到流形上的忠实点。在此基板上,415M 解码器在重建和对抗目标下进行训练,以将降级的嵌入映射回并一次性解码到像素空间。由此产生的模型 RAESR 在 RealSR、DRealSR、LSDIR 和 DIV2K-Val 上实现了最先进的对抗性和基于扩散的恢复器之间的最佳保真度感知权衡,在单个 H20 GPU 上每 512 x 512 图像需要 37 毫秒。将底物替换为相同配方下潜在的 VAE,在每个指标上都会有所损失。

正确的潜空间中的超分辨率:冷冻视觉基础基底的原论文方法或结果图
图 5:$\times 4$ 定性比较,所有 16 个面板。带框区域的全帧;右:$4\times$ 最近邻放大倍数下每种方法的区域,我们的红色区域。从顶部开始的块:LSDIR、RealSR、DIV2K-Val。最佳观看放大。应用程序。 J 显示了其他示例。