论文

揭示原生统一多模态模型中的理解-生成协同作用:从表示、任务到系统

Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System

模型评测模型行为与机制分析

摘要

虽然统一多模态模型 (UMM) 在单个模型中联合执行视觉理解和生成,但功能统一并不能保证学习协同作用:这两个目标可能会相互加强、争夺能力,或者只是共存。我们在受控的、结构本机的环境中研究它们在表示、任务和系统级别上的关系,而无需预先训练视觉先验。在表示层面,我们发现每个目标都向另一个目标提供了有用的信号:生成丰富了为理解而学习的视觉特征,而理解则增强了生成的视觉-语言对齐。然而,当两个目标被迫通过相同的计算路径时,其中一个往往会占主导地位。任务解耦架构专门处理冲突的视觉计算,同时保留语义交互,避免了这种不对称的退化。在任务层面,通过三个案例研究,我们发现当理解和生成任务依赖于共享知识时,正向双向迁移。在系统级别,我们表明,在明确需要图像理解和生成的复杂任务上,端到端 UMM 的性能优于匹配的规划器 - 执行器管道。总之,这些结果表明 UMM 的价值超出了统一接口的范围:适当的专业化、共享任务知识和端到端优化可以将共存转化为协同。