论文

SPAR:统一多模态模型的语义像素自对准和自适应路由

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

模型架构新型架构

摘要

多模态 大语言模型 (MLLM) 在视觉理解方面取得了显着的成功,但由于语义感知和像素级重建之间的基本特征差异,在视觉生成方面仍然受到限制。弥合这一差距需要克服两个核心挑战:赋予语义编码器高保真重建能力,以及在不依赖外部教师的情况下有效地将生成模型与语义空间对齐。为此,我们提出了一种新颖的统一多模态框架,具有 \textbf{S}emantic-\textbf{P}ixel 自对齐和 \textbf{A}daptive \textbf{R}outing (\textbf{SPAR})。首先,为了协调语义感知与像素级重建,我们引入了非对称双流统一标记器。轻量级语义流锚定判别性特征,而 Transformer 增强像素流将细粒度视觉细节恢复到统一紧凑的潜在空间中。其次,为了消除外部依赖性,我们提出了一种自对齐生成范例,该范例本身利用此优化的分词器作为扩散模型的内部对齐教师。此外,为了促进这个统一空间内灵活的多模态交互,我们引入了动态词元路由,它使每个词元能够根据其不同的语义需求自适应地聚合多层 MLLM 特征。大量实验表明,SPAR 建立了最先进的统一架构,实现了卓越的生成和重建质量,同时保留了基本的视觉理解能力。