论文

GeoScaffold:导航策略的几何脚手架

GeoScaffold: Learning Compact Geometric Latents via Reconstruction for Efficient Vision-Language Navigation

摘要

近期视觉语言导航(VLN)系统日益采用流式Video-LLM策略,把自我中心RGB观测与指令直接映射为低层动作。但这些策略从2D预训练继承了薄弱的3D几何先验。既有几何感知扩展要在推理时持续付费:深度传感器、3D编码器或逐步感知工具调用。我们提出GeoScaffold,把这笔代价一次性在训练期支付、把几何内化进策略本身的几何监督框架:先在训练轨迹的深度图上学习紧凑深度tokenizer并冻结;再用少量可学习几何查询token微调策略,训练其隐状态重建导航关键几何(深度、连通性、可通行性)。该监督把查询状态变成动作解码的紧凑几何潜变量,并经共享权重把几何内化进骨干自身表示。如脚手架一般,tokenizer、目标生成器与重建头在训练后弃置,骨干与动作接口不变。大量实验显示GeoScaffold在连续VLN基准上一致超越领先的纯视觉导航器,为空间感知具身导航模型的轻量边缘部署提供实用范式。