论文
提升未标记的互联网级数据以实现 3D 场景理解
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
摘要
带注释的 3D 场景数据稀缺且获取成本高昂,而互联网上却有大量未标记的视频。在本文中,我们证明了精心设计的数据引擎可以利用网络精选、未标记的视频自动生成训练数据,以促进 3D 场景理解中的端到端模型以及人工注释的数据集。我们识别并分析自动化数据生成中的瓶颈,揭示决定未标记数据学习效率和有效性的关键因素。为了跨不同感知粒度验证我们的方法,我们评估了三个任务,涵盖底层感知(即 3D 对象检测和实例分割)到高级推理(即 3D 空间视觉问答(VQA)和视觉语言导航(VLN))。根据我们生成的数据训练的模型表现出强大的零样本性能,并在微调后显示出进一步的改进。这证明了利用现成的网络数据作为通向更强大的场景理解系统的途径的可行性。