论文
SceneScribe-1M:具有全面几何和语义注释的大规模视频数据集
SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations
摘要
3D几何感知和视频合成的融合对富含语义和时空信息的大规模视频数据产生了前所未有的需求。虽然现有数据集已经提高了 3D 理解或视频生成能力,但在提供大规模支持这两个领域的统一资源方面仍然存在巨大差距。为了弥合这一鸿沟,我们引入了 SceneScribe-1M,这是一个新的大规模、多模式视频数据集。它包含一百万个野外视频,每个视频都经过精心注释,包括详细的文本描述、精确的相机参数、密集的深度图和一致的 3D 点轨迹。我们通过在各种下游任务中建立基准来展示 SceneScribe-1M 的多功能性和价值,这些任务包括单目深度估计、场景重建和动态点跟踪,以及文本到视频合成(带或不带相机控制)等生成任务。通过开源 SceneScribe-1M,我们的目标是为研究提供全面的基准和催化剂,促进模型的开发,这些模型既可以感知动态 3D 世界,又可以生成可控、逼真的视频内容。