论文

SenseNova-U1:通过 NEO-unify 架构统一多模态理解和生成

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

模型架构新型架构

摘要

最近的大型视觉语言模型(VLM)从根本上仍然受到持续二分法的限制:理解和生成被视为不同的问题,导致碎片化的架构、级联的管道和不对齐的表示空间。我们认为,这种鸿沟不仅仅是一个工程制品,而且是阻碍本地多模态智能出现的结构性限制。因此,我们引入了 SenseNova-U1,这是一种基于 NEO-unify 的原生统一多模式范式,其中理解和生成作为单个底层过程的协同视图而演变。我们推出了两个原生统一变体,SenseNova-U1-8B-MoT 和 SenseNova-U1-A3B-MoT,分别建立在密集(8B)和专家混合(30B-A3B)理解基线上。它们根据第一原理设计,在文本理解、视觉语言感知、知识推理、代理决策和空间智能方面可与顶级仅理解 VLM 相媲美。同时,它们提供强大的语义一致性和视觉保真度,在传统或知识密集型任意图像 (X2I) 合成、复杂的文本丰富的信息图生成以及带或不带思维模式的交错视觉语言生成方面表现出色。除了性能之外,我们还展示了详细的模型设计、数据预处理、pre-/后训练 以及支持社区研究的推理策略。最后但并非最不重要的一点是,初步证据表明我们的模型超越了感知和生成,在视觉-语言-动作(VLA)和世界模型(WM)场景中表现强劲。这指向了一个更广泛的路线图,其中模型不会在模式之间转换,而是以本机方式思考和行动。多模式人工智能不再是连接单独的系统,而是构建一个统一的系统并信任从内部产生的必要功能。