论文

统一多模式生成的愿景

Vision as Unified Multimodal Generation

模型训练监督微调与指令调优

摘要

我们将计算机视觉制定为统一的多模态生成,其中异构视觉任务在统一多模态模型的本机文本和图像生成空间中表达,没有特定于任务的架构。在此表述下,SenseNova-Vision 使用自然语言指令和可选的视觉提示来指定任务、目标区域或视图以及解码约定,并生成响应作为符号输出的文本、用于密集空间预测的图像或用于合成任务的混合文本和图像输出。为了支持大规模训练,我们将不同的计算机视觉注释转换为与这些生成空间兼容的指令响应示例,从而产生了 SenseNova-Vision 语料库,这是一个涵盖文本、图像和混合目标的计算机视觉指令响应语料库。从现成的预训练统一多模态模型开始,SenseNova-Vision 主要在此语料库上进行训练,并使用辅助多模态数据作为能力保留混合物,并且不需要特定于任务的预测头或架构修改。由此产生的模型涵盖了广泛的视觉任务,包括检测、OCR、关键点估计、分割、深度估计、表面法线预测、点图和相机姿态估计,同时支持结合类别、颜色、区域和其他视觉线索的语言定义变体。实验表明,单个统一模型可以在结构化视觉理解、密集几何预测、分割和多视图视觉几何方面与领先的任务专用系统相匹配。这些结果表明,统一的多模态生成作为将计算机视觉功能集成到通用基础模型中的可扩展途径。该模型和语料库是公开的。