论文
GN0:迈向视觉语言导航中生成、评估和策略学习的统一范式
GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation
摘要
具身导航将智能代理与物理世界连接起来,是通用机器人智能的基础。导航数据的可用性和质量有限,限制了视觉和语言导航(VLN)系统的泛化和长视野能力。为了解决这个问题,我们策划了不同的 3D 场景并开发了大规模导航数据的自动化管道,从而产生了 GN-Matrix 数据集。我们以 3D 高斯泼溅 (3DGS) 引擎为基础,推出了支持交互式漫游和碰撞感知导航的高保真仿真平台。我们进一步提出了 GN-Bench,这是第一个基于 BEV 的基准,结合了用于人机交互评估的动态 3DGS 化身。为了利用模拟器,我们开发了一个强化学习驱动的导航基础模型,即“打破和建立”(BAE)。经过监督学习后,DAgger 将模型暴露于执行轨迹引发的状态,打破了以专家为中心的狭窄分布,并实现了下游 RL 探索。这种统一的 VLN 范式集成了基于地图和无地图的任务,包括指令跟踪、人类跟踪和目标导航。 GN-BAE 将高保真 3DGS 渲染鸟瞰图表示形式化为紧凑内存,解锁 VLM 中的潜在空间推理。对 GN-Bench 和 VLN-CE 的广泛评估表明 GN0 优于最先进的 VLN 方法。总体而言,GN-Matrix 提供了一个涵盖数据、模拟和学习的统一框架,推动了研究和工业应用中的嵌入式导航。