论文

视频生成模型是通用视觉学习器

Video Generation Models are General-Purpose Vision Learners

模型训练预训练

摘要

在下一个标记预测的推动下,NLP 从特定于任务的模型转变为强大的通用基础模型。那么,实现计算机视觉通用模型所需的等效催化剂是什么?在本文中,我们认为大规模文本到视频的生成可以作为计算机视觉的强大 预训练 范例,提供必要的时空先验、视觉语言对齐和通用视觉智能所需的可扩展性。我们介绍了 GenCeption,它利用预先训练的视频生成扩散主干来定义前馈感知模型,能够执行由文本指令引导的各种视觉任务。实证结果表明,GenCeption 在各种任务中实现了最先进的性能,包括深度、表面法线和相机姿态估计、表达参考分割和 3D 关键点预测,通常匹配或超越专用模型(例如 DepthAnything3、SAM3、D4RT、VGGT-Omega、Sapiens、David、Genmo 和 Lotus-2)。此外,在可比较的设置下,视频生成预训练主干网的性能优于替代预训练范例(例如 V-JEPA 和视频 MAE)。重要的是,GenCeption 展示了初步的数据和模型扩展特性以及卓越的数据效率,其性能可与 D4RT 和 VGGT-Omega 等领先模型相媲美,但训练数据少 7 到 500 个。最后,GenCeption 还表现出了有趣的突发行为:专门针对合成人类视频训练的模型可以推广到现实世界的镜头和分布外的对象类别(例如动物和机器人)。这些发现表明,视频生成不仅仅是一种综合工具,而且是实现物理世界通用视觉智能的基本途径。项目页面:https://genception.github.io