论文
JoLT:上下文引导高分辨率平铺生成的联合潜在轨迹
JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation
摘要
尽管文本到图像生成模型产生了令人印象深刻的结果,但它们很难生成细节丰富的高分辨率 (HR) 图像。当前文献通过低分辨率到高分辨率的方法解决了这个问题。首先,生成低分辨率(LR)图像。然后,使用 LR 图像作为附加提示生成上采样版本。在本文中,我们提出了联合潜在轨迹(JoLT)。为了生成图像,JoLT 使用两个流在每个采样步骤联合对 LR 和 HR 潜在图像进行去噪。 LR潜在控制整体布局,而HR潜在控制细节。我们将两个分支机构互连起来,共同整合它们的信息。我们广泛验证了我们的方法,展示了其相对于竞争基线的优势。由此产生的图像不仅细节丰富,而且视觉上令人愉悦,为艺术创作开辟了新的途径。