论文
SenseNova-U1.5:迈向原生统一视觉智能
SenseNova-U1.5: Towards Native Unified Visual Intelligence
摘要
我们推出了 SenseNova-U1.5,这是一种 8B-MoT 原生统一多模态模型,可以在无编码器和无 VAE 的架构中理解、推理并生成视觉内容。我们通过空间相干的块重建来增强其视觉界面,并通过精心策划的生成和编辑数据、改进的任务制定、结构提示增强和高达 4K 的原始分辨率来扩展其训练。对于后训练,我们优化了视觉美学、双语文本渲染、信息图生成和图像编辑方面的专业专家,并通过多专家同策略 蒸馏来巩固他们的能力。经过广泛的评估,SenseNova-U1.5 极大地提高了图像保真度、文本渲染、复杂构图、多参考编辑和交错生成,同时改进了指令遵循并保留了受试者身份、几何形状和未修改的区域。尽管在生成数据中对结构化格式的接触有限,SenseNova-U1.5 可以有效地推广到长、复杂和结构化的视觉指令,进一步证明多模态理解可以转移到视觉规划和创作。总之,这些发现将原生统一建模定位为通向在完全端到端框架内感知、推理和创建的系统的一条有前途的道路。我们将开源训练代码,包括监督微调、强化学习和同策略 蒸馏。