论文
ScrollScape:利用视频扩散先验解锁 32K 图像生成
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors
摘要
虽然扩散模型擅长生成传统尺寸的图像,但推动它们以极端纵横比 (EAR) 合成超高分辨率图像通常会引发灾难性的结构故障,例如对象重复和空间碎片。这种限制从根本上源于缺乏稳健的空间先验,因为静态文本到图像模型主要是在具有常规维度的图像分布上进行训练的。为了克服这一瓶颈,我们提出了 ScrollScape,这是一种新颖的框架,通过两项核心创新将 EAR 图像合成重新表述为连续的视频生成过程。通过将巨大画布的空间扩展映射到视频帧的时间演化,ScrollScape 利用视频模型固有的时间一致性作为强大的全局约束,以确保远程结构完整性。具体来说,扫描位置编码 (ScanPE) 跨帧分配全局坐标,充当灵活的移动摄像机,而滚动超分辨率 (ScrollSR) 利用视频超分辨率先验来规避内存瓶颈,有效地将输出缩放到前所未有的 32K 分辨率。 ScrollScape 在精选的 3K 多比例图像数据集上进行了微调,有效地将预先训练的视频先验与 EAR 生成任务保持一致。广泛的评估表明,它消除了严重的局部伪影,显着优于现有的图像扩散基线。因此,我们的方法克服了固有的结构瓶颈,以确保在极端规模下跨不同领域的卓越的全局一致性和视觉保真度。