论文

绿绿色可通行、红色不可通行:通过 VLA 导航策略的语义分割实现视觉定位

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

摘要

视觉-语言-动作(VLA)模型使机器人能够根据自然语言和视觉目标进行导航,但仍然容易受到感知干扰和模糊的场景解释的影响。本文首次对 VLA 导航策略的视觉定位进行了实证评估。我们提出了一种基于实时分段的视觉定位方法,该方法使用 SegFormer 以绿色突出显示可通行区域,以红色突出显示不可通行区域。评估两种变体:仅观察分割和联合观察目标增强。在 Grand Tour 数据集上使用 OmniVLA,我们发现视觉定位将最远航路点的平均航路点误差降低了 27-44%,具体取决于指令长度。长指令的好处比短指令大,并且视觉定位对图像目标几乎没有改善。归一化误差分析表明,视觉定位主要充当轨迹长度调节器,将预测路径长度减少 30%,而不会改进单位距离推理。我们的结果表明,视觉定位提供了一种简单、计算成本低廉的方法来改进 VLA 导航,而无需模型重新训练,尽管它无法补偿分布外指令中丢失的训练信号。