论文
SoftNav:将 3D 场景词元注入 VLM 中以实现具体导航
SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation
摘要
在目标导向的具体导航中,智能体必须在看不见的环境中定位指定目标,3D 场景理解和导航推理必须协同工作。当前的方法通过文本将 3D 场景信息传输到视觉语言模型 (VLM),这表明我们测试的配置中存在表示差距;受控消融证实直接嵌入级传输显着优于评估的文本序列化格式。我们引入了 SoftNav,它通过轻量级投影仪将实体级 3D 连续表示(每个检测到的对象或边界一个标记)作为软标记注入到 VLM 的隐藏空间中。 3D 编码器和 VLM 冻结后,仅需要约 1,200 个样本和约 17M 可训练参数。在 HM3D-OVON 上,SoftNav 在三个分割中实现了 74.2%/68.3%/66.7% SR,在 SR 和 SPL 方面都超过了所有先前的方法;相同的导航策略将零样本转移到 GOAT-Bench (67.2% SR)、SG3D (47.2% s-SR) 和现实世界的机器人部署,而无需重新训练或架构修改。将 3D 场景词元直接注入 VLM 可以弥补表示差距,从而以最少的训练实现可转移导航。