论文

HiTokSR:具有分层代码本的从粗到细的分词器,用于高保真真实世界图像超分辨率

HiTokSR: A Coarse-to-Fine Tokenizer with Hierarchical Codebooks for High-Fidelity Real-World Image Super-Resolution

应用与实践内容创作

摘要

矢量量化 (VQ) 生成模型在现实世界图像超分辨率 (Real-ISR) 中显示出有希望的结果。然而,现有方法通常依赖于将低频结构与高频纹理纠缠在一起的整体潜在空间。这种纠缠迫使单个码本捕获一组组合复杂的结构-纹理配对,这限制了表征能力并限制了码本的利用率。为了解决这个问题,我们提出了 HiTokSR,一个分层词元预测框架。 HiTokSR 没有使用单个码本,而是沿着通道维度将潜在空间划分为频率感知组,并使用独立的子码本对每个组进行量化。这种从粗到细的设计将全局结构与精细细节分开,增强组合表达力,同时避免高维最近邻查找的优化不稳定性。为了进一步提高语义一致性,我们的生成器通过自适应特征调制、多尺度类标记和表示对齐损失集成了视觉基础模型的先验。此外,我们在解码器 微调 期间引入了索引级扰动策略,以弥合离散标记预测中的训练测试差异。对现实世界基准的大量实验表明,HiTokSR 在感知质量和重建保真度方面都实现了最先进的性能。