论文

统一多模态模型的语义生成调整

Semantic Generative Tuning for Unified Multimodal Models

模型训练监督微调与指令调优

摘要

统一多模态模型 (UMM) 致力于将视觉理解和视觉生成整合到单一架构中。然而,流行的训练范例通过稀疏文本信号独立优化理解,并通过密集像素目标生成。这种解耦策略会产生不对齐的表示空间,将视觉理解与生成隔离开来,并阻碍它们的相互强化。这项工作首次对生成 后训练 进行了系统研究,其中我们将分层视觉任务制定为生成代理,以弥合 UMM 中的隔离。我们的实证研究表明,高级语义任务,特别是图像分割,可以作为最佳代理。与用纹理细节分散模型注意力的低级任务不同,分割提供的结构语义可以显着增强以视觉为中心的感知和生成布局保真度。基于这些见解,我们引入了语义生成调整(SGT),这是一种利用分段作为生成代理来调整和协同多模式功能的新颖范式。机理分析进一步表明,SGT 从根本上提高了特征线性可分离性,优化了视觉文本注意力分配模式。广泛的评估表明,SGT 持续提高了主流基准的多模态理解和生成保真度。我们的代码可以在 https://song2yu.github.io/SGT/ 上找到。