论文

用于超高分辨率图像合成的空间 Gram 对齐

Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis

摘要

现代超高分辨率图像合成在很大程度上依赖于大规模预训练潜在扩散模型(LDM)的强大生成能力。虽然最近的表示对齐方法通过将基础模型(例如 SAM 或 DINO)中的视觉先验提炼为生成潜在特征而被证明是有效的,但将这些方法扩展到极端分辨率下的预训练 LDM 会暴露出关键的可学习性与保真度冲突。具体来说,强制使用直接补丁式特征 蒸馏 本质上会扰乱预先训练的潜在流形,最终导致生成退化。为了解决这个瓶颈,我们提出了空间语法对齐(SGA),这是一种新颖的框架,它明确地利用视觉基础模型的表示先验,同时保留 LDM 的原生生成能力。 SGA 超越了限制性的直接对齐,通过将生成特征的内部自相似性与基础先验的内部自相似性对齐来施加非侵入性的空间约束。这种空间约束有效地建立了宏观结构一致性,而原生生成目标保留了原始 LDM 固有的微观像素级保真度。值得注意的是,这种多功能策略无缝集成了预先训练的 LDM 中的中间扩散特征和 VAE 潜伏。大量实验表明,SGA 在超高分辨率文本到图像合成方面实现了最先进的性能,在全局结构完整性和细粒度视觉细节之间实现了有效协调。代码可在 https://github.com/zhang0jhon/SGA 获取。