论文

MMFace-DiT:用于高保真多模态人脸生成的双流扩散 Transformer

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

模型架构Transformer

摘要

最近的多模态人脸生成模型通过使用分割掩模、草图或边缘图等空间先验增强基于文本的条件,解决了文本到图像扩散模型的空间控制限制。这种多模态融合使得可控合成能够与高级语义意图和底层结构布局保持一致。然而,大多数现有方法通常通过附加辅助控制模块或将单独的单模态网络拼接在一起来扩展预先训练的文本到图像管道。这些临时设计继承了架构约束、重复参数,并且经常在模式冲突或潜在空间不匹配的情况下失败,从而限制了它们跨语义和空间域执行协同融合的能力。我们推出 MMFace-DiT,这是一种统一的双流扩散 Transformer,专为协同多模态面部合成而设计。其核心新颖之处在于双流 Transformer 块,该块并行处理空间(掩模/草图)和语义(文本)标记,并通过共享旋转位置嵌入(RoPE)注意力机制将它们深度融合。这种设计可以防止模态主导,并确保严格遵守文本和结构先验,以实现前所未有的空间语义一致性,从而实现可控面部生成。此外,新颖的模态嵌入器使单个内聚模型能够动态适应不同的空间条件,而无需重新训练。 MMFace-DiT 与六种最先进的多模态人脸生成模型相比,视觉保真度和快速对齐提高了 40%,为端到端可控生成建模建立了灵活的新范例。代码和数据集可在我们的项目页面上找到:https://vcbsl.github.io/MMFace-DiT/