论文
多尺度图像超分辨率的分层图像标记化
Hierarchical Image Tokenization for Multi-Scale Image Super Resolution
摘要
我们引入了一种基于视觉自回归(VAR)建模最新进展的多尺度图像超分辨率(ISR)方法。 VAR 模型使用残差量化 (RQ) 将图像标记化分解为可加的、逐渐增加的尺度,这种方法与我们的目标 ISR 任务完美契合。先前利用这种协同作用的作品存在两个主要缺点。首先,由于 RQ 的限制,它们只能以预定义的固定比例生成图像,无法将中间输出映射到相应的图像比例。他们还依赖大型骨干网或大型注释数据语料库来实现更好的性能。为了解决这两个缺点,我们在 ISR 的 VAR 训练中引入了两个新颖的组件,旨在提高其灵活性并降低其复杂性。特别是,我们引入了a)一种\textbf{分层图像标记化(HIT)}方法,该方法逐步表示不同尺度的图像,同时强制跨尺度的标记重叠,以及b)一种\textbf{直接偏好优化(DPO)正则化项},仅依赖于(LR,HR)对,鼓励Transformer产生后者而不是前者。我们提出的 HIT 充当 VAR 训练的强归纳偏差,从而产生一个小模型(VARSR 的 300M 参数与 1B 参数),无需外部训练数据即可实现最先进的结果,并通过单次前向传递提供多尺度输出。