论文

VIVAS:通过视觉语言统一自回归监督激活 VLM 预训练中的视觉感知

VIVAS: Vitalizing Visual Perception in VLM Pre-training via Vision-language Unified Autoregressive Supervision

模型训练预训练

摘要

虽然视觉语言模型(VLM)表现出强大的能力,但它们仍然面临着一个关键的限制:细粒度的视觉感知不足,这从根本上限制了它们的多模态理解。我们将此瓶颈归因于预训练期间以文本为主的优化偏差,这促使模型忽略细粒度的视觉细节,从而限制了多模态理解的能力。我们研究发现,克服这一瓶颈需要两个关键要素:(1)确保稳定的训练动态的统一词元空间范式,以及(2)模态一致的密集视觉监督信号,富含结构粒度和语义信息,以捕获关键的视觉表示。基于这些见解,我们提出了 VIVAS,这是一个基于统一标记空间范式的框架,它引入了密集结构语义视觉标记器,通过合并视觉词汇将文本词汇扩展为统一的视觉语言词汇。在预训练过程中,VIVAS 对视觉细节和语言内容进行视觉-语言统一自回归监督,从而增强视觉感知,提高多模态理解。 VIVAS 在 12.4T 词元上进行端到端训练,在 7 个任务和 39 个多模式基准测试中实现了最先进的性能。