论文

UniDDT:通过解耦扩散统一多模态理解和生成 Transformer

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

模型架构混合架构

摘要

统一多模态模型(UMM)已成为通用多模态智能的关键方向,它将理解和生成集成到单个框架中。然而,现有的 UMM 面临着突出的挑战:(1)视觉理解和生成任务之间固有的学习冲突,导致这两个任务的建模不理想; (2)不同的理解和生成视觉空间阻碍了可扩展性; (3)过度依赖任务特定数据,忽视了文本图像理解和生成的二元性。为了应对这些挑战,我们提出了 UniDDT,它利用 Noisy ViT 编码器和 LLM 来统一视觉生成和理解任务的语义编码,同时采用单独的扩散解码器将扩散解码与文本解码解耦。借助此 Noisy ViT 编码器,UniDDT 能够利用潜在空间作为统一的视觉表示,从而实现理解和生成任务之间的无缝兼容性。因此,可以平衡生成任务中的可扩展性和理解任务中的语义表达能力。此外,我们从相同的图像文本对构建双重数据结构,促进生成和理解数据之间的相互依赖,以利用其固有的二元性。大量实验表明,UniDDT 实现了多模态理解和生成的有效统一,并增强了语义一致性和可扩展性。对于视觉生成任务,我们的 UniDDT 获得了 0.87 GenEval 分数和 86.9 DPG 总分。对于多模态理解任务,我们的 UniDDT 在 MME 基准上获得 1699.5 分,在 SEEDbench 上获得 76.5 的总分。