论文

图像生成器是多面手视觉学习者

Image Generators are Generalist Vision Learners

模型训练预训练

摘要

最近的研究表明,图像和视频生成器表现出零样本视觉理解行为,在某种程度上让人想起 LLM 如何通过生成预训练开发语言理解和推理的新兴能力。虽然长期以来人们一直猜测创建视觉内容的能力意味着理解它的能力,但有限的证据表明生成视觉模型已经发展了强大的理解能力。在这项工作中,我们证明图像生成训练的作用类似于 LLM 预训练,并让模型学习强大且通用的视觉表示,从而在各种视觉任务上实现 SOTA 性能。我们介绍 Vision Banana,这是一种通才模型,通过混合原始训练数据和少量视觉任务数据对 Nano Banana Pro (NBP) 进行指令调整而构建。通过将视觉任务的输出空间参数化为 RGB 图像,我们将感知无缝地重新构建为图像生成。我们的通才模型 Vision Banana 在涉及 2D 和 3D 理解的各种视觉任务上取得了 SOTA 结果,击败或匹敌零样本领域专家,包括分割任务上的 Segment Anything Model 3 和度量深度估计上的 Depth Anything 系列。我们证明,这些结果可以通过轻量级指令调整来实现,而无需牺牲基本模型的图像生成功能。优异的结果表明图像生成预训练是一种通用的视觉学习器。它还表明图像生成可以作为视觉任务的统一和通用接口,类似于文本生成在语言理解和推理中的作用。我们可能会见证计算机视觉的重大范式转变,其中生成视觉预训练在构建生成和理解的基础视觉模型中发挥着核心作用。