论文
TrioPose:用于姿势引导文本到图像生成的原生三流扩散 Transformer
TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation
摘要
在复杂的多人场景中,姿势引导的文本到图像生成通常会受到肢体扭曲和特征串扰的影响。虽然现有的基于 UNet 的适配器难以应对远程空间依赖性,但新兴的多模态扩散 Transformer (MM-DiTs) 提供了卓越的全局建模。然而,MM-DiT 中的原始信号串联严重破坏了预先训练的潜在分布。为了解决这个问题,我们提出了 TrioPose,一个基于 SD3.5M 架构构建的原生姿势驱动框架。具体来说,我们引入了一种三流姿势感知 DiT (TSPA-DiT),它将姿势视为一种独立的模态。它采用分层激活和零初始化双残差注入来平滑地执行几何约束,同时保留预先训练的潜在稳定性。为了解决严重的多实例遮挡问题,我们设计了一种可学习的关系偏差掩模,将拓扑连接性分类为细粒度的物理状态,将它们映射到连续注意力软约束中,以有效地解耦实例间干扰。此外,姿势引导的空间损失加权策略使用热图导出的误差图来调节本地扩散目标,将解剖监督严格集中在容易变形的区域。大量实验表明,TrioPose 在具有挑战性的基准测试中实现了最先进的性能,包括 Human-Art、CrowdPose 和 OCHuman。值得注意的是,它在 Human-Art 上获得了 64.33的 AP,比现有技术提高了 30%$,同时为复杂的多人生成中的视觉保真度和文本图像语义对齐设定了新标准。