论文
将人物组合在一起:多人交互场景的迭代姿势图像生成
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
摘要
尽管最近取得了进展,文本到图像模型仍然难以生成语义多样且构图准确的多人交互场景,通常会陷入重复的布局、刻板的姿势和基础较差的交互。在这项工作中,我们通过引入双重姿势图像表示来弥补这一差距,该表示将以人为中心的结构先验引入到预训练的扩散 Transformer 中。我们的模型联合预测 2D 姿态可视化图像及其相应的 RGB 图像,使结构和外观在学习过程中共同进化。其核心是跨模式对齐方案绑定文本、姿势和图像表示,确保跨模式的一致基础。此外,我们设计了迭代场景构建方案,逐步生成复杂的多人交互,同时有效分解整体生成复杂性。大量的实验表明,我们的方法大大提高了多人图像生成中的即时对齐和场景多样性。