论文
StructGen:通过结构化上下文建模消除多参考图像生成的歧义
StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling
摘要
多参考图像生成旨在通过在文本指令下集成多个参考图像的属性来合成图像。随着参考数量的增加,该任务需要复杂的语义理解,例如将属性与预期主题正确关联,以及在主题及其环境之间规划出连贯的空间排列。现有的方法仅依赖于自然语言指令,通常无法准确捕捉这些复杂的意图,从而导致语义错位和不一致的生成。我们确定了这些限制背后的两个关键因素:自然语言指令通常冗长且含糊不清,并且高质量的多参考数据稀缺。为了解决这些问题,我们提出了 StructGen,它采用结构化的、类似字典的格式来编码多个参考图像,从而能够明确且明确地指定生成意图。为了支持这种设计,我们构建了一个基于高质量真实图像的结构化数据集,并开发了相应的训练框架,以及用于具有挑战性的多参考场景的专用基准。对公共基准和我们提出的基准的大量实验表明,StructGen 在语义对齐和详细参考生成一致性方面始终优于现有方法,特别是在具有多个引用的复杂指令下。代码可在https://jianingpeng0382.github.io/StructGen/获取