论文

PoseAdapter:复杂多对象场景的双流 2.5D 可控图像生成

PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes

模型架构Transformer

摘要

虽然文本到图像(T2I)扩散模型取得了显着的成功,但多对象场景中的精确空间和方向控制仍然是一个持续的挑战。现有方法要么依赖于计算成本昂贵的密集 3D 地图,要么遭受严重的属性泄漏和“剪切粘贴”伪影。为了解决这些限制,我们提出了 PoseAdapter,一种用于高保真 2.5D 可控图像生成的轻量级框架。它不是使用密集的空间地图,而是使用有效的条件布局建立精确的空间角度锚点:单个对象标题、2D 边界框和 3D 角度。为了解决严格实例隔离和全局一致性之间的生成权衡,我们引入了上下文感知双流表示。通过并行屏蔽和未屏蔽路径将本地对象标记和关系丰富的场景标记注入现代 MM-DiT 架构的视觉流中,PoseAdapter 消除了属性泄漏,同时保留了自然的对象间关系和场景级连贯性。为了支持这种范式,我们构建了 OrientLayout,这是一个具有标准化 2.5D 注释和实例级解耦语义的高质量数据集。大量实验表明,PoseAdapter 在空间精度、方向精度和多目标视觉保真度方面优于最先进的基线。代码和数据集可在 https://github.com/cyf23/PoseAdapter 获取。