论文
UniRect-CoT:通过具有内在理解的反射整流增强统一多模态模型的生成
UniRect-CoT: Enhancing Generation in Unified Multimodal Models via Reflective Rectification with Inherent Understanding
摘要
统一多模态模型 (UMM) 旨在将视觉理解和生成集成到单个结构中。然而,这些模型表现出明显的能力不匹配,它们的理解能力往往优于它们的生成能力。这种不匹配表明模型丰富的内部知识虽然对于理解任务有效,但在生成过程中并未得到充分利用。为了解决这个问题,我们从人类的“边画边思考”范式中汲取灵感,在这种范式中,人类不断反思中间结果,并根据对预期目标的理解对其进行修改。在本文中,我们提出了 UniRect-CoT,一个 无需训练 统一整改思想链框架。我们将 UMM 中的多步去噪过程视为一种内在的视觉推理过程,其中间状态提供了持续反思和纠正的机会。通过利用UMM固有的理解,根据目标指令反思中间结果并进行相应的纠正,我们的框架在单个去噪轨迹内形成了一条反思性的思想链,使模型的内部知识能够指导整个过程的生成。具体来说,UMM 生成状态条件反射,其在同一模型下的自回归负对数似然定义了模型本机可微语义损失,将文本反射转换为梯度以进行潜在纠正。大量实验表明,UniRect-CoT 可以推广到现有的基于流的 UMM,持续增强文本到图像生成的整体性能。