论文

用于多主体上下文图像生成的多模态 大语言模型

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

应用与实践内容创作

摘要

文本到图像 (T2I) 生成的最新进展使得能够根据描述合成视觉上连贯的图像,但生成包含多个给定主题的图像仍然具有挑战性。随着参考身份数量的增加,现有方法经常遭受主题缺失和语义漂移的困扰。为了解决这个问题,我们提出了 MUSIC,这是第一个专门为 \textbf{MU}lti-\textbf{S}object \textbf{I}n-\textbf{C}ontext 图像生成而设计的 MLLM。为了克服数据稀缺的问题,我们引入了自动且可扩展的数据生成管道,消除了手动注释的需要。此外,我们通过视觉思维链(CoT)机制增强模型对多主体语义关系的理解,引导从主体图像到语义和生成的逐步推理。为了减轻身份纠缠和管理视觉复杂性,我们开发了一种新颖的语义驱动的空间布局规划方法,并展示了其测试时的可扩展性。通过在训练过程中结合复杂的主题图像,我们提高了模型的链式推理能力。此外,我们还策划了 MSIC,这是一个为多主题上下文生成量身定制的新基准。实验结果表明,MUSIC 在多主体和单主体场景中均显着优于其他方法。