论文

MUNITE:面向任意模态组合生成的统一潜变量推断

MUNITE: Unified Multimodal Latent Inference for Any-to-Any Multimodal Generation

模型架构上下文与知识应用与实践新型架构上下文工程内容创作

摘要

我们引入了 MUNITE,一种用于灵活的任意多模态生成的潜在变量框架,它将编码和潜在生成视为不同数量的观察证据下的相同推理问题。给定模态的任何子集,MUNITE 对与完整观察相关的潜在表示的条件分布进行建模。完整观察恢复确定性编码,无观察恢复潜在边缘,中间子集定义条件潜在推理,所有这些都在单个条件流模型内。共享的潜在样本捕获必须在生成的目标之间保持一致的变化,而特定于模态的生成解码器则独立地对剩余的不确定性进行建模。为了从不完整的训练示例中学习这些条件分布,我们通过自蒸馏扩展了条件流匹配:以更丰富的可用观察为条件的预测监督以相同中间潜在状态的较小子集为条件的相同模型。当更丰富的证据轨迹遵循精确的轨迹时 条件流,这提供了与全目标去噪相同的预期学习信号。在 PolyMNIST-D-Q、FFHQ64 和图像-文本-音频中,MUNITE 实现了有竞争力或更好的生成质量和源-目标对齐,并具有更高的联合生成一致性。特别是,它在所有一对多和无条件图像-文本-音频比较中获得了最高的一致性,显示了跨不同多模态设置的统一潜在推理的有效性。

MUNITE:面向任意模态组合生成的统一潜变量推断:论文原图
图 4:PolyMNIST-D-Q 单目标生成。图标显示观察到的标签:数字、2×22\times 2 网格中阴影的条件象限或放置在该象限中的数字。每列都会生成在其输入下列出的视图。