论文
外观指针——扩散的多模态区域控制 Transformer
Appearance Pointers -- Multimodal Region Control of Diffusion Transformers
摘要
可控的图像生成对于创意专业人士来说仍然具有挑战性,他们通常需要对材料、对象身份和空间安排进行精确的区域控制,而仅通过文本提示无法可靠地实现这些控制。 Diffusion Transformer (DiTs) 本身可以摄取源自文本和图像的异构词元,但它们缺乏确定这些词元应在何处以及如何影响输出的机制。我们引入了外观指针,即紧凑的标记,通过将文本或图像输入与用户指定的掩码对齐,引导 DiT 在正确的空间位置找到正确的外观线索。外观指针由区域对应网络生成,并通过空间聚合机制进行细化,使模型能够处理多个区域描述,而不会显着增加词元负载。我们的方法引入了第一个与模态无关的接口,用于 DiT 中的本地化多模态控制,而无需从头开始重新训练基本模型。在一系列指标中,我们的单一模型达到或超越了特定模态的最先进方法的性能,为生成图像合成中的精确、区域感知、多模态指导提供了一条简单且可扩展的路径。