论文
LatentUMM:统一多模态模型的双潜在对齐
LatentUMM: Dual Latent Alignment for Unified Multimodal Models
摘要
统一多模态模型(UMM)通过学习共享的潜在空间在理解和生成方面实现了强大的性能,但它们经常表现出这两种能力之间的功能不一致。我们观察到,这个问题并不是源于缺乏共享表示,而是源于映射到和映射出潜在空间的转换之间缺乏明确的对齐。因此,生成和重新编码可能遵循不一致的轨迹,导致模态转换下的语义漂移。在这项工作中,我们提出了 LatentUMM,这是一个构建增强的共享潜在空间的框架,以明确地对齐这些转换并提高跨模式一致性。 LatentUMM 由两个阶段组成。首先,双潜在对齐在模态和容量级别上强制执行一致性:跨模态对齐使用更强的嵌入模型来强加结构化的跨模态语义,而双容量对齐在生成和重新编码下强制执行双向一致性。其次,潜在动态稳定通过随机潜在采样轨迹和偏好优化来提高鲁棒性,有利于更好地保持语义一致性的轨迹。实验表明 LatentUMM 持续提高了不同架构之间的多模式一致性。代码位于:https://github.com/AIFrontierLab/TorchUMM/tree/main/src/umm/post_training/LatentUMM。