论文

MUNI:用于相干任意生成的多模态统一潜在扩散

MUNI: Multimodal Unified Latent Diffusion for Coherent Any-to-Any Generation

模型架构新型架构

摘要

我们引入了 MUNI,一种用于任意生成的端到端多模态潜在扩散框架,它通过共享随机潜在变量统一了子集条件跨模态生成和无条件联合采样。现有的多模态生成模型主要基于 LLM,这限制了特定模态生成器的利用,并且需要文本配对数据进行训练。最近基于扩散和流的任意扩展采取了不同的方向,但仍然依赖于文本对齐嵌入、完全配对训练或匹配维度确定性映射。 MUNI 依赖于两项互补的贡献,一项是架构方面的贡献,一项是训练目标方面的贡献。首先,我们将潜在扩散扩展到多模态任意生成端到端:MUNI 不是预先计算冻结潜在空间然后在其上拟合先验的标准两阶段方法,而是在一个目标下联合训练特定于模态的编码器、表达解码器和基于单个共享流的先验。其次,我们发现,多模态变分推理的标准聚合规则在与学习的先验和表达性解码器结合使用时是不够的。合适的共享潜在变量必须同时满足生成模态之间的一致性、潜在子集的预测充分性以及潜在内容的最少性。我们提出了一个路由训练目标,其结构选择使潜伏与这些标准相一致,并在可实现的环境中承认最小充分性特征。 PolyMNIST-Quadrant-Labels 和大规模图像-文本-音频基准测试表明,MUNI 在条件生成方面匹配或超过最强基线,同时在无条件一致性方面打开了最大裕度。项目页面:https://muni-proj.github.io/。