论文

Mise-en-Scène:扩散中隐式布局的出现 Transformer 用于人机交互设计共同创作

Mise-en-Scène: Implicit Layout Emergence in Diffusion Transformers for Human-AI Design Co-Creation

应用与实践内容创作

摘要

从用户提供的元素自动合成图形设计既需要连贯的整体构图,又需要准确保存每个资产。现有方法将布局预测为具有语言模型的显式边界框坐标,然后将资源粘贴到其中,这将空间规划与视觉合成分开,并且往往会产生僵化的、比例错误的组合。相反,我们询问布局是否可以隐式出现在预训练的图像编辑扩散 Transformer 中。我们提出了 Mise-en-Scène,一个两阶段的框架。在第一阶段,扩散Transformer与小型的、经过精心挑选的LoRA相适应,起草了一个完整的设计,其中元素的排列与渲染的画布共同出现。在第二阶段,确定性的匹配和放置步骤将原始高分辨率资源移动到起草的位置,这保证了资源的精确保真度,并产生了设计师可以不断完善的可编辑的分层设计,而不是平面图像。值得注意的是,对预训练的 Transformer 进行最小程度的修改就已经足够了,无需通常为多元素生成引入的专门调节机制。在大型 PrismLayersPlus 基准上,Mise-en-Scène 生成的设计在所有比较方法中的感知质量上最接近 真值,远远超过 LLM 布局规划器和专门的布局 Transformer,而我们的匹配和放置阶段弥补了与 真值 复合材料之间剩余的保真度差距。