论文
UVU:通过视觉语言统一自回归范式提高多模态理解
UVU: Improving Multimodal Understanding via Vision-Language Unified Autoregressive Paradigm
摘要
尽管多模态大语言模型(MLLM)取得了显着的进步,但它们的细粒度视觉理解受到主要依赖于稀疏文本监督的限制。现有引入视觉监督的努力通常是在训练后进行的,此时视觉表示已经基本固定,导致此类信号主要充当辅助约束,而不是塑造感知特征的主要力量。在本文中,我们的目标是通过将视觉监督直接纳入预训练阶段,从根本上重塑模型的感知主干。我们观察到像素级图像块和文本标记自然地共存于一个共享的、原始的高维空间中,该空间具有固有的输入对称性。利用这一见解,我们提出了 UVU,一种新颖的视觉语言统一自回归框架,避开了矢量量化。它独特地采用连续视觉编码来无损表示视觉输入,并提出了一种大规模迭代分层聚类算法来构建像素级视觉码本,从而扩展了统一监督的词汇量,并实现了像素级图像标记和文本标记的自回归生成。 UVU将像素级视觉感知与语义级视觉理解有效协同,内化视觉重建能力,释放视觉监督在预训练阶段增强理解的促进作用。跨多个任务的大量实验表明,MLLM 能够在 UVU 的监督学习范式下实现卓越的多模态理解性能。