论文
语义浏览:图像生成的可控多样性
Semantic Browsing: Controllable Diversity for Image Generation
摘要
现代文本到图像模型在视觉保真度和快速依从性方面表现出色。然而,这种严格遵守是以多样性为代价的:生成的样本往往会崩溃为单一的视觉解释。现有的提高多样性的方法产生的输出是由偶然变化驱动的,而不是有意义的设计选择。这激发了多样性任务的新变体,其中对生成的样本强制执行结构。我们引入了一种可实现语义浏览的受控多样性方法,用户可以在结构化图像库中导航,并通过系统地遍历有意义的、可解释的变化轴来体验创造性探索。实现这种级别的语义控制需要对场景有深入的理解。我们利用了最近的文本到图像模型是在详细图像描述上进行训练的事实,有效地将语义决策与像素生成解耦。这实现了范式转变:我们不再依赖文本到图像模型中的随机变化,而是直接在文本级别引入多样性。通过利用丰富的文本表示,我们允许视觉语言模型(VLM)在整个场景上下文中运行。为了克服标准 VLM 典型的通用输出,我们采用代理工作流程,明确强制与原始提示相协调的结构化变化。我们证明我们的方法可以产生多样化且可导航的设计空间,其中每个变化都对应于特定的、用户可理解的语义决策。