论文

统一多模态模型中理解与生成之间的可迁移性

Transferability Between Understanding and Generation in Unified Multimodal Models

模型评测模型行为与机制分析

摘要

统一多模态模型(UMM)将图像理解和生成集成在一个架构中,但这两个任务如何交互仍然没有得到充分研究。我们研究 UMM 中的 $\boldsymbol{\mathsf{transferability}}$:在一项任务上训练一项能力是否可以在没有明确监督的情况下提高另一项任务上的相同能力。通过受控实验,我们凭经验发现,可转移性取决于具有完全共享的 Transformer 主干和统一视觉编码器的架构模型,表现出一致的跨任务转移,而松散耦合的设计则很少或根本没有。利用这种可转移性,我们提出了实用的训练策略。提高目标生成能力(例如计数)的最直接方法是直接微调生成,但这可能会由于分布偏移而降低视觉质量。相反,我们训练相应的理解任务并让它转移到生成中,这提高了特定于能力的生成性能,同时最小化分布偏移。我们通过三个功能(计数、空间关系和文本识别/生成)验证了这一点,表明可以在 UMM 中系统地利用跨任务可转移性。