论文

DIVA:利用统一多模态模型中的表示差异进行相互强化

DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

模型训练监督微调与指令调优

摘要

基于单一架构构建的统一多模态模型 (UMM) 在理解和生成方面都表现出了令人印象深刻的性能。我们发现了一个根本性的挑战,即由不同的监督信号引起的归纳偏差:生成分支更喜欢能够重建的高保真、细粒度的表示,而理解则倾向于对与任务无关的因素保持不变的语义区分嵌入。因此,在单一主干内优化这些互补但不等价的目标会导致相互损害而不是增强。在本文中,我们首先分析了统一主干中这种干扰的根本原因,并揭示了它们内部表示的互补结构。受观察的启发,我们提出了 DIVA,一个自我改进的 后训练 框架,将表示分歧转化为内部协同。通过基于两个互补的信息流将视觉表示显式分解为共享和独特的组件,DIVA 使理解和生成分支能够实现有益的转移,同时通过互信息估计保持独特信息的完整性,免受交叉流干扰。尽管具有普遍性,我们的方法始终在视觉理解(+7.82%)和生成(+8.46%)方面取得了进步。官方代码位于:https://github.com/Jayyy-H/DIVA。