论文
STBridge:共享目标对齐,以桥接 UMM 中的理解和生成
STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs
摘要
统一多模态模型(UMM)旨在将视觉理解和生成集成到单个架构中,但架构统一本身并不能确保语义一致性。模型可以正确描述预期目标,同时生成不一致的编辑。这暴露了理解与代际对齐的差距:语言和视觉输出存在于不同的空间,但应该受到相同的目标语义的控制。我们研究图像编辑中的这一差距,其中指令定义了可以描述和视觉实现的目标状态。给定源图像和编辑指令,我们将 UMM 的目标图像描述与其编辑后的图像进行比较,以测试两个输出是否收敛于相同的结果。我们的分析表明,现有的 UMM 仍然很弱,特别是对于细粒度的实体、属性、空间关系和局部细节,这表明语义统一不能仅通过架构来实现。为了弥补这一差距,我们提出了 STBridge,这是一种共享目标对齐框架,通过共同目标状态将理解和生成联系起来。这里,目标图像描述表达了所需的视觉结果,而编辑后的图像在视觉上实现了它,用从目标表达到目标实现的共享信息流取代了单独的特定于任务的路径。 STBridge 遵循先对齐再优化的策略:有监督的 微调 首先建立共享目标通道,顺序强化学习进一步细化以目标为中心的协调。在视觉理解、图像生成和图像编辑基准方面,STBridge 不断改进初始化模型。对齐分析证实,STBridge 缩小了模型描述的内容与其生成的内容之间的差距,证明共享目标对齐是一种有效的 后训练 策略,用于桥接 UMM 中的理解和生成。