论文
从像素到文字——迈向大规模原生单视觉模型
From Pixels to Words -- Towards Native One-Vision Models at Scale
摘要
当前的视觉语言模型(VLM)通常通过多级对齐将单独的图像编码器和语言解码器拼接在一起,这是一种模块化框架,不可避免地会在帧之间分割像素级信号并分散早期的像素-字交互。与此同时,原生 VLM 尽管在单图像上具有令人印象深刻的性能,但在多图像、视频理解和空间智能方面仍然很大程度上尚未得到探索。因此,我们引入了 NEO-ov,这是一种原生基础模型,可以端到端学习跨帧和像素词对应关系,无需任何外部编码器、辅助适配器或事后融合。通过完全消除模块边界,NEO-ov 使细粒度和统一的时空建模能够在模型内部自然出现。值得注意的是,NEO-ov 在很大程度上缩小了与模块化同行的差距,同时在细粒度视觉感知方面表现出色,验证了原生“单视觉”架构不仅可行,而且在规模上具有竞争力。除了经验性能之外,我们还推出了系统的架构分析和详细的训练方法,以促进后续的本地多模态建模。我们的代码和模型可在以下网址公开获取:https://github.com/EvolvingLMMs-Lab/NEO。