论文

NavGen:用视觉生成模型规模化构建三维导航数据

NavGen: Visual Generative Models as a Scalable Data Engine for Embodied 3D Navigation

模型训练合成数据

摘要

通用机器人模型越来越依赖于大型且多样化的数据集。然而,对于具身三维导航,现有的数据源面临着一个基本的权衡:模拟数据可以大规模生成,但常常存在视觉模拟与真实的差距,而现实世界的飞行数据提供真实的观察结果,但收集成本高昂。本文研究另一个方向:使用高保真视觉生成模型作为具身三维导航的可扩展数据引擎。我们推出了 NavGen,这是一种文本到视频数据生成管道,可在室内和室外场景中生成不同的视觉语言导航 (VLN) 片段。我们还提出了一种风格多样化方法,可以扩大收集困难且成本高昂的长尾数据。生成的数据集包含大约 40 万个导航片段。我们通过多个指标根据现有无人机导航数据集评估我们的数据集,发现在我们的数据上训练的模型通常会随着规模的扩大而改进,优于在现有数据集上训练的模型。为了验证现实世界的可转移性,我们将世界动作模型范式中训练好的模型部署到现实世界的飞行实验中。最终模型在不同的导航任务和环境中实现了 75% 的成功率。

NavGen利用视觉生成模型构建常规和多样化困难导航任务,并评估真实飞行迁移。
图1(图注摘要):NavGen利用视觉生成模型构建常规和多样化困难导航任务,并评估真实飞行迁移。