论文
LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力
LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model
摘要
统一模型 (UM) 有望实现跨异构模式理解和生成内容的能力。与仅仅生成视觉内容相比,使用 UM 进行交错的跨模式推理更有前景和价值,例如,用于解决需要密集视觉思维的理解问题,通过自我反思改进视觉生成,或在逐步行动干预的指导下对物理世界的视觉动态进行建模。然而,现有的 UM 需要像素解码作为桥梁,因为它们用于理解和生成的视觉表示不相交,这既无效又低效。在本文中,我们介绍了 LatentUM,这是一种新颖的统一模型,它表示共享语义潜在空间内的所有模态,消除了视觉理解和生成之间像素空间中介的需要。这种设计自然可以实现灵活的交错跨模式推理和生成。除了提高计算效率之外,共享表示还大大减轻了编解码器偏差并增强了跨模式对齐,使 LatentUM 能够在视觉空间规划基准上实现最先进的性能,通过自我反射突破视觉生成的极限,并通过预测共享语义潜在空间内的未来视觉状态来支持世界建模。